成績:リカレントニューラルネットワーク

← カテゴリー一覧へ戻る

問題論点回答回数正答率最短秒平均秒
Attention context vectorの標準的な式は? Attention 0 0% - -
Attentionであるサンプルの全source位置がmaskされた場合に注意すべきことは? Attention 0 0% - -
Attentionのalignment score(energy)は何を表す? Attention 0 0% - -
Attentionのcontext vectorはdecoderの全時刻で同じ? Attention 0 0% - -
Attentionを使うモデルは必ずRNNを含む? Attention 0 0% - -
Attention付きSeq2Seqは長文問題を完全に解決する? Attention 0 0% - -
Attention機構がSeq2Seqへ導入された主な目的は? Attention 0 0% - -
Attention重みのentropyが低い分布は、一般にどのような注目を表す? Attention 0 0% - -
Global Attentionで全source・target位置のscoreを計算する個数は? Attention 0 0% - -
Global Attentionとは? Attention 0 0% - -
Hard Attentionとは? Attention 0 0% - -
Local Attentionとは? Attention 0 0% - -
Local Attentionの主な利点は? Attention 0 0% - -
RNN encoder-decoderのsoft Attentionは、encoderの何を利用する? Attention 0 0% - -
Soft Attentionが通常の誤差逆伝播で学習しやすい理由は? Attention 0 0% - -
padding済みsourceへAttentionを行うとき、maskはsoftmaxの前と後のどちらへ入れるのが基本? Attention 0 0% - -
soft Attentionの重みαをscoreから作る代表的な処理は? Attention 0 0% - -
加法型Attentionでencoder H_e、decoder H_d、attention内部A次元なら代表的なParameter shapeは? Attention 0 0% - -
素のdot-product Attentionでencoder状態とdecoder状態に必要な次元条件は? Attention 0 0% - -
BPTTでh_tへ流れ込む勾配には、主にどの2種類がある? BPTT 0 0% - -
BPTTで共有重みWの勾配は各時刻の寄与をどう扱う? BPTT 0 0% - -
BPTTの数学的な基盤は? BPTT 0 0% - -
BPTTはどの順序で隠れ状態の勾配を伝える? BPTT 0 0% - -
BPTTは何の略で、何を行う手法? BPTT 0 0% - -
Full BPTTのメモリ使用量が系列長とともに増える主な理由は? BPTT 0 0% - -
RNNの隠れバイアスb_hへの勾配はどう求める? BPTT 0 0% - -
TimeLSTMでBPTTを始めるときdhとdcをどう初期化・更新する? BPTT 0 0% - -
TimeRNN.backward終了後のself.dhは何への勾配? BPTT 0 0% - -
a_t=W_xh x_t+W_hh h_(t-1)+bのとき、h_(t-1)へ戻る局所勾配は? BPTT 0 0% - -
h_t=tanh(a_t)の局所逆伝播は? BPTT 0 0% - -
列ベクトル表記でa_t=W_xh x_t+…のとき、W_xhへの局所勾配は? BPTT 0 0% - -
列ベクトル表記でa_t=…+W_hh h_(t-1)+bのとき、W_hhへの局所勾配は? BPTT 0 0% - -
列ベクトル表記でo_t=W_hy h_t+b_yのとき、W_hyへの局所勾配は? BPTT 0 0% - -
各時刻に損失L_tがあるRNNで、総損失L=Σ_t L_tならパラメータ勾配は? BPTT 0 0% - -
最終時刻だけに損失があるTimeRNNで、(N,H)の勾配を(N,T,H)へ配置するには? BPTT 0 0% - -
最終時刻だけに損失を置くRNNと全時刻に損失を置くRNNでは、直接の教師信号はどう違う? BPTT 0 0% - -
系列が長いとFull BPTTの計算時間が増える理由は? BPTT 0 0% - -
要素ごとの活性化h_t=φ(a_t)で、∂h_t/∂a_tのJacobianは? BPTT 0 0% - -
CTC prefix beam searchがgreedy decodingより広く探索するものは? CTC 0 0% - -
CTCLossのinput_lengthsは何を表す? CTC 0 0% - -
CTCLossのtarget_lengthsは何を表す? CTC 0 0% - -
CTCが明示的なフレーム単位alignment教師を必要としない理由は? CTC 0 0% - -
CTCでtarget yの確率p(y|x)はどう求める? CTC 0 0% - -
CTCでtargetの連続した同一文字「ll」を表すpathにblank等の区切りが必要なのはなぜ? CTC 0 0% - -
CTCでtarget長Uに隣接同一ラベルがR組あるとき、必要な最小入力長の下限は? CTC 0 0% - -
CTCのcollapse演算Bはpathへどの順で処理を行う? CTC 0 0% - -
CTCのgreedy decodingの基本手順は? CTC 0 0% - -
CTCのtarget系列にblankラベル自体を含めてよい? CTC 0 0% - -
CTCの全alignment pathを素朴に列挙せず確率を求める代表的な方法は? CTC 0 0% - -
CTCは何の略で、何を学習する損失? CTC 0 0% - -
PyTorch CTCLossでreduction='mean'の平均方法は? CTC 0 0% - -
PyTorch CTCLossのzero_infinity=Trueは何をする? CTC 0 0% - -
PyTorch CTCLossへraw logitsをそのまま渡してよい? CTC 0 0% - -
PyTorch nn.CTCLossの既定blankクラスindexは? CTC 0 0% - -
標準CTCが入力xを条件に仮定する出力時刻間の関係は? CTC 0 0% - -
GRUが提案された主な狙いは? GRU 0 0% - -
GRUにLSTMの出力ゲートに相当する独立ゲートはある? GRU 0 0% - -
GRUにはセル状態がないので、過去情報を記憶できない? GRU 0 0% - -
GRUのリセットゲートr_tの役割は? GRU 0 0% - -
GRUのリセット・更新ゲートにsigmoidを使う理由は? GRU 0 0% - -
GRUの候補隠れ状態にtanhを使う標準的な理由は? GRU 0 0% - -
GRUの更新ゲートz_tの役割は? GRU 0 0% - -
GRUの正式名称は? GRU 0 0% - -
GRUはLSTMのような独立したセル状態c_tを持つ? GRU 0 0% - -
GRUはLSTMより常に高速? GRU 0 0% - -
GRUはMany-to-Oneの系列分類に使える? GRU 0 0% - -
Keras GRUのreset_after=True版がbiasを2系統持つ理由は? GRU 0 0% - -
PyTorch nn.GRUの戻り値h_nをr・z・nの3ゲートへ分解できる? GRU 0 0% - -
Stateful GRUで次のチャンクへ渡す状態は? GRU 0 0% - -
標準GRUの2つのゲートは? GRU 0 0% - -
長期依存タスクではLSTMがGRUより常に高精度? GRU 0 0% - -
AVILEN規約h_t=(1−z_t)h_(t-1)+z_t h̃_tで、z_t=0と1は何を意味する? GRUゲート 0 0% - -
GRUでr_tが0に近いと、候補状態の計算はどうなる? GRUゲート 0 0% - -
GRUでreset gateが0でも、最終h_tから過去状態の影響が必ず消えるとは限らないのはなぜ? GRUゲート 0 0% - -
GRUの更新ゲートz_tは1つのスカラー? GRUゲート 0 0% - -
PyTorch規約のGRUでz_t=0ならh_tはどうなる? GRUゲート 0 0% - -
PyTorch規約のGRUでz_t=1ならh_tはどうなる? GRUゲート 0 0% - -
AVILEN GRUのz・r・h_hatの順伝播式は? GRU数式 0 0% - -
AVILEN教材で使う逆規約のGRU更新式は? GRU数式 0 0% - -
GRUの候補状態でreset gateを掛ける位置は全実装で同じ? GRU数式 0 0% - -
Keras GRUのreset_after=Trueは何を意味する? GRU数式 0 0% - -
PyTorch規約h_t=(1−z_t)⊙n_t+z_t⊙h_prevで、z_tへの局所勾配は? GRU数式 0 0% - -
PyTorch規約のGRUでz=0.7、h_prev=0.4、候補n=−0.2ならh_tは? GRU数式 0 0% - -
PyTorch規約のGRUでリセットゲートr_tの式は? GRU数式 0 0% - -
PyTorch規約のGRUで候補状態n_tの式は? GRU数式 0 0% - -
PyTorch規約のGRUで更新ゲートz_tの式は? GRU数式 0 0% - -
PyTorch規約のGRUで隠れ状態h_tの更新式は? GRU数式 0 0% - -
CECとは何の略で、LSTMでは何を指す? LSTM 0 0% - -
Keras LSTMのunit_forget_bias=Trueは初期化時に何をする? LSTM 0 0% - -
LSTMが単純RNNに追加する中心的な状態は? LSTM 0 0% - -
LSTMが単純RNNより勾配を保ちやすい中心的な構造は? LSTM 0 0% - -
LSTMのh_tとc_tの役割の違いは? LSTM 0 0% - -
LSTMの忘却ゲートbiasを正の値で初期化する狙いは? LSTM 0 0% - -
LSTMは何の略で、何を改善するためのモデル? LSTM 0 0% - -
LSTMは勾配消失を完全に防ぐ? LSTM 0 0% - -
Peephole LSTMの出力ゲートは、一般的にどのセル状態を参照する? LSTM 0 0% - -
Peephole connection付きLSTMとは? LSTM 0 0% - -
PyTorch nn.LSTMでproj_sizeにhidden_size以上を指定できる? LSTM 0 0% - -
PyTorch nn.LSTMのゲート格納順と、AVILENスクラッチ教材の例の順序は? LSTM 0 0% - -
PyTorchのLSTM projectionとは? LSTM 0 0% - -
PyTorchの標準nn.LSTMはpeephole connectionを引数1つで有効化できる? LSTM 0 0% - -
Stateful LSTMで次のチャンクへ持ち越すべき状態は? LSTM 0 0% - -
他の間接経路を除くと、LSTMのセル経路で∂c_t/∂c_(t-1)は何? LSTM 0 0% - -
同じI・Hなら、標準LSTMは単純RNNよりセル計算とパラメータが多いのはなぜ? LSTM 0 0% - -
標準LSTMのセル状態c_tは必ず[-1,1]に収まる? LSTM 0 0% - -
LSTMでf=1、i=1ならセル状態は必ず保持されるだけ? LSTMゲート 0 0% - -
LSTMでf_t=0なら、前のセル状態の直接項はどうなる? LSTMゲート 0 0% - -
LSTMでf_t=1、i_t=0ならc_tはどうなる? LSTMゲート 0 0% - -
LSTMでo_t=0なら、セル状態c_tも消える? LSTMゲート 0 0% - -
LSTMの候補セルg_tにtanhを使う理由は? LSTMゲート 0 0% - -
LSTMの候補セルg_tは何を表す? LSTMゲート 0 0% - -
LSTMの入力ゲートi_tの役割は? LSTMゲート 0 0% - -
LSTMの出力ゲートo_tの役割は? LSTMゲート 0 0% - -
LSTMの忘却ゲートf_tの役割は? LSTMゲート 0 0% - -
LSTMの忘却・入力・出力ゲートにsigmoidを使う理由は? LSTMゲート 0 0% - -
標準LSTMの3つのゲートは? LSTMゲート 0 0% - -
LSTMでf=0.8、i=0.25、g=0.4、c_prev=0.5の1要素についてc_tは? LSTM数式 0 0% - -
LSTMの4ブロックを連結入力q_t=[x_t;h_(t-1)]から一括計算する式は? LSTM数式 0 0% - -
LSTMのセル状態c_tの更新式は? LSTM数式 0 0% - -
LSTMの候補セルの標準式は? LSTM数式 0 0% - -
LSTMの入力ゲートの標準式は? LSTM数式 0 0% - -
LSTMの出力ゲートの標準式は? LSTM数式 0 0% - -
LSTMの忘却ゲートの標準式は? LSTM数式 0 0% - -
LSTMの隠れ状態h_tの更新式は? LSTM数式 0 0% - -
LSTM式の⊙は何を表す? LSTM数式 0 0% - -
前問のc_t=0.5で出力ゲートo=0.6ならh_tは? LSTM数式 0 0% - -
AVILENのPyTorch双方向LSTMを生成するコードは? PyTorch実装 0 0% - -
AVILENの双方向LSTM分類でCrossEntropyLossへ返すべき値は? PyTorch実装 0 0% - -
PyTorch RNN系のoutputとh_nの内容の違いは? PyTorch実装 0 0% - -
PyTorchでtag_space.squeeze()を無条件に使う危険は? PyTorch実装 0 0% - -
PyTorchで単純RNN層を作る基本形は? PyTorch実装 0 0% - -
PyTorchのnn.GRUは何を返す? PyTorch実装 0 0% - -
PyTorchのnn.LSTMは何を返す? PyTorch実装 0 0% - -
PyTorchのnn.RNNは何を返す? PyTorch実装 0 0% - -
hidden_size=Hの双方向LSTMから2クラス分類するLinearは? PyTorch実装 0 0% - -
nn.CrossEntropyLossへRNN分類headの出力を渡す前にsoftmaxする? PyTorch実装 0 0% - -
num_layers=3のnn.RNNのoutputは3層すべての全時刻出力を含む? PyTorch実装 0 0% - -
projectionなし・batched inputのPyTorch RNN系で、初期状態を省略または明示する際の注意は? PyTorch実装 0 0% - -
多層・双方向RNNのh_nは何を含む? PyTorch実装 0 0% - -
最終ミニバッチを常にreshape(batch_size,C)すると何が起こり得る? PyTorch実装 0 0% - -
RNNが系列長方向の完全な並列計算をしにくい理由は? RNN基礎 0 0% - -
RNNのループを時間方向に展開する目的は? RNN基礎 0 0% - -
RNNの代表的な応用分野は? RNN基礎 0 0% - -
RNNの初期隠れ状態h_0には何を使う? RNN基礎 0 0% - -
RNNの隠れ状態h_tはクラス確率そのもの? RNN基礎 0 0% - -
RNNの隠れ状態h_tは何を表す? RNN基礎 0 0% - -
RNNは何の略で、どのようなデータを扱うためのニューラルネットワーク? RNN基礎 0 0% - -
RNNは画像内の文字を扱う用途には使えない? RNN基礎 0 0% - -
RNN・LSTM・GRUのうち、常に最も高精度なモデルは決まっている? RNN基礎 0 0% - -
Stateful RNNとStateless RNNの違いは? RNN基礎 0 0% - -
ミニバッチ内の系列サンプル順をshuffleすることと、各系列内の時刻順をshuffleすることは同じ? RNN基礎 0 0% - -
全結合型の順伝播ネットワークとRNNの中心的な違いは? RNN基礎 0 0% - -
単方向RNNの時刻tの出力は、通常どこまでの入力を利用する? RNN基礎 0 0% - -
単純RNNの順伝播計算量は系列長Tに対して概ねどう増える? RNN基礎 0 0% - -
単純RNNは時刻tの隠れ状態を何から更新する? RNN基礎 0 0% - -
単純RNNは理論上、長さの異なる系列を処理できる? RNN基礎 0 0% - -
同じ入力要素x_tでもRNNの出力が文脈によって変わるのはなぜ? RNN基礎 0 0% - -
因果的な系列モデルの時刻tの予測に入力x_(t+1)を使ってよい? RNN基礎 0 0% - -
独立した系列の間で隠れ状態を誤って持ち越すと何が起こる? RNN基礎 0 0% - -
系列データとは? RNN基礎 0 0% - -
系列データの順序を無作為に並べ替えると、一般に何が失われる? RNN基礎 0 0% - -
音声認識でRNNが利用できる理由は? RNN基礎 0 0% - -
RNNでa_t=W_xh x_t+W_hh h_(t-1)+b_hと置いたとき、a_tは何? RNN数式 0 0% - -
RNNの出力層に使う活性化関数は常にsoftmax? RNN数式 0 0% - -
RNNの隠れ状態から時刻tの出力を求める基本式は? RNN数式 0 0% - -
h_tを求める式の右辺にh_t自身をそのまま置くのが不適切なのはなぜ? RNN数式 0 0% - -
単純RNNでtanhが隠れ活性化に使われる理由と限界は? RNN数式 0 0% - -
単純RNNの隠れ状態を求める標準的な式は? RNN数式 0 0% - -
時刻tのRNN更新にx_(t-1)だけを使う式が不適切なのはなぜ? RNN数式 0 0% - -
線形RNN h_t=W_hh h_(t-1)+W_xh x_tで、h_tを初期状態と入力列に展開すると? RNN数式 0 0% - -
語彙数Vの次トークン予測でsoftmaxは何に対して適用する? RNN数式 0 0% - -
GNMTは何の略? Seq2Seq 0 0% - -
Seq2Seq decoderの生成開始を知らせる代表的な特殊トークンは? Seq2Seq 0 0% - -
Seq2Seq decoderは通常、何を合図に生成を終了する? Seq2Seq 0 0% - -
Seq2Seqとは? Seq2Seq 0 0% - -
Seq2Seqのdecoderの役割は? Seq2Seq 0 0% - -
Seq2Seqのencoderの役割は? Seq2Seq 0 0% - -
Seq2Seqの入力系列長と出力系列長は固定で同じである必要がある? Seq2Seq 0 0% - -
encoderの最終状態次元とdecoderの初期状態次元が異なる場合の代表的な接続方法は? Seq2Seq 0 0% - -
古典的Seq2Seqで入力系列を反転する工夫の狙いは? Seq2Seq 0 0% - -
古典的なAttentionなしSeq2Seqの固定長context bottleneckとは? Seq2Seq 0 0% - -
自己回帰的decoderとは? Seq2Seq 0 0% - -
TBPTTで区間境界の隠れ状態をdetachする目的は? TBPTT 0 0% - -
TBPTTで状態をdetachすることと、状態を0へリセットすることの違いは? TBPTT 0 0% - -
TBPTTとは? TBPTT 0 0% - -
TBPTTの切断長を短くする主なトレードオフは? TBPTT 0 0% - -
zero_grad()とRNN状態のdetach()は同じ役割? TBPTT 0 0% - -
長い系列をチャンクに分けるだけで、detachしなければTBPTTになる? TBPTT 0 0% - -
Teacher Forcingとは? Teacher Forcing 0 0% - -
Teacher Forcingに関連するexposure biasとは? Teacher Forcing 0 0% - -
decoder入力とtargetを1トークンずらす理由は? Teacher Forcing 0 0% - -
Keras Denseのunitsは何を表す? TensorFlow・Keras 0 0% - -
Keras GRUのreturn_state=Trueで返るstateは内部ゲート値? TensorFlow・Keras 0 0% - -
Keras LSTMがTensorFlow backendでcuDNN実装を使う代表的な条件は? TensorFlow・Keras 0 0% - -
Keras LSTMとGRUでreturn_state=Trueにしたとき、stateの個数はどう違う? TensorFlow・Keras 0 0% - -
Keras RNNに保持された実行状態を明示的に消すメソッドは? TensorFlow・Keras 0 0% - -
Keras RNN層のreturn_sequences=TrueとFalseの違いは? TensorFlow・Keras 0 0% - -
Keras RNN系でunroll=Trueにする主なトレードオフは? TensorFlow・Keras 0 0% - -
Keras RNN系のdropoutとrecurrent_dropoutの違いは? TensorFlow・Keras 0 0% - -
Keras stateful RNNで固定batch_sizeが必要なのはなぜ? TensorFlow・Keras 0 0% - -
Keras stateful RNNで連続バッチ間に必要なサンプル対応は? TensorFlow・Keras 0 0% - -
Keras stateful RNNをfitするときshuffleは通常どう設定する? TensorFlow・Keras 0 0% - -
KerasでLSTM(units)とRNN(LSTMCell(units))は性能実装上も常に同じ? TensorFlow・Keras 0 0% - -
Kerasでtoken単位損失を明示mask付き平均にする手順は? TensorFlow・Keras 0 0% - -
Kerasで真の双方向SimpleRNNを作る基本形は? TensorFlow・Keras 0 0% - -
Kerasのstateful RNNが保持するstatesはlayer weightsに含まれる? TensorFlow・Keras 0 0% - -
Kerasの独自RNN cellがcallで返す基本的な2要素は? TensorFlow・Keras 0 0% - -
Keras独自RNN cellのstate_sizeとoutput_sizeは何を定義する? TensorFlow・Keras 0 0% - -
TensorFlowでmask(N,T)をRNN出力(N,T,H)へ掛けるshape変換は? TensorFlow・Keras 0 0% - -
Leaky unitでαが0に近いと、過去情報はどうなる? スキップ・Leaky接続 0 0% - -
Leaky unitでαが1に近いと、記憶の時間スケールはどうなる? スキップ・Leaky接続 0 0% - -
Leaky係数αはどのように決められる? スキップ・Leaky接続 0 0% - -
RNNのLeaky unitの代表的な更新式は? スキップ・Leaky接続 0 0% - -
時間方向skip connectionを入れれば長期依存性と勾配爆発は必ず解決する? スキップ・Leaky接続 0 0% - -
時間方向のskip connectionをRNNへ入れる狙いは? スキップ・Leaky接続 0 0% - -
AVILEN GRUでリセットゲート出力rへの勾配drは? スクラッチ実装 0 0% - -
AVILEN GRUで候補状態pre-activationへの勾配dtは? スクラッチ実装 0 0% - -
AVILEN GRUで更新ゲート出力zへの勾配dzは? スクラッチ実装 0 0% - -
AVILEN GRUで結合勾配dWx・dWhを復元する順序は? スクラッチ実装 0 0% - -
AVILEN GRUのdh_prevへ合流する主な経路は? スクラッチ実装 0 0% - -
AVILEN GRUのdxはどの経路の和になる? スクラッチ実装 0 0% - -
AVILEN GRUのリセットゲートでdt・dWhr・dWxrは? スクラッチ実装 0 0% - -
AVILEN GRUの候補経路でdhrとdh_prevへの寄与は? スクラッチ実装 0 0% - -
AVILEN GRUの更新ゲートでdt・dWhz・dWxzは? スクラッチ実装 0 0% - -
AVILEN GRUの結合重みWx・Whを分割する順序は? スクラッチ実装 0 0% - -
AVILEN LSTMで各ブロックのpre-activation勾配は? スクラッチ実装 0 0% - -
AVILEN LSTMのbackwardでdAを連結する順序は? スクラッチ実装 0 0% - -
AVILEN LSTMの一括pre-activation Aをf・g・i・oへ分けるsliceは? スクラッチ実装 0 0% - -
AVILEN LSTMセルのdWx・dWh・dbは? スクラッチ実装 0 0% - -
AVILEN LSTMセルのdxとdh_prevは? スクラッチ実装 0 0% - -
AVILEN TimeAffine.backwardのdW・db・dxは? スクラッチ実装 0 0% - -
AVILEN TimeGRUのWx・Whの初期化式は? スクラッチ実装 0 0% - -
AVILEN TimeLSTM.backwardへ(N,H)の勾配だけ渡すとどうする? スクラッチ実装 0 0% - -
AVILEN TimeLSTMでstateful=Falseならforward開始時のhとcは? スクラッチ実装 0 0% - -
AVILEN TimeLSTMのXavier型初期化でWx・Wh・bをどう作る? スクラッチ実装 0 0% - -
AVILEN TimeLSTMのreset_stateは何をリセットする? スクラッチ実装 0 0% - -
AVILEN TimeRNNでstateful=Falseならforward開始時のhは? スクラッチ実装 0 0% - -
AVILEN TimeRNNのWx・Wh・bの初期化式は? スクラッチ実装 0 0% - -
AVILEN TimeSoftmaxWithLoss.backwardの基本式と出力shapeは? スクラッチ実装 0 0% - -
AVILEN TimeSoftmaxWithLossがone-hot教師ts(N,T,V)を受けたときの処理は? スクラッチ実装 0 0% - -
AVILENのRNNセルはforward時にcacheへ何を保存する? スクラッチ実装 0 0% - -
AVILENのRNNセル逆伝播で、dWhとdWxを求める式は? スクラッチ実装 0 0% - -
AVILENのRNNセル逆伝播で、dx・dh_prev・dbを求める式は? スクラッチ実装 0 0% - -
AVILENのTimeGRUスクラッチ実装はバイアスParameterを持つ? スクラッチ実装 0 0% - -
AVILENの学習ループがSimpleRNNClassifierへ渡すxsの実際のshapeは? スクラッチ実装 0 0% - -
AVILENの系列二値分類器はTimeRNNのどの出力をAffineへ渡す? スクラッチ実装 0 0% - -
AVILENの行ベクトルRNNセルで、順伝播のpre-activation tを実装する式は? スクラッチ実装 0 0% - -
AVILENスクラッチGRUで、候補状態の再帰重みWhへの勾配dWhは? スクラッチ実装 0 0% - -
AVILENスクラッチLSTMで、セル状態の分岐を合流した勾配dsは? スクラッチ実装 0 0% - -
AVILENスクラッチLSTMで、前セル状態へ戻す勾配dc_prevは? スクラッチ実装 0 0% - -
AVILENスクラッチLSTMで、活性化微分前のdi・df・do・dgは? スクラッチ実装 0 0% - -
AVILEN問4のSimpleRNNClassifierでloss_layerとrnn_layerは? スクラッチ実装 0 0% - -
AVILEN規約h_next=z*h_hat+(1-z)*h_prevの直接勾配分岐は? スクラッチ実装 0 0% - -
Embedding.backwardで同じ単語IDが複数回現れる場合、重み勾配をどう集約する? スクラッチ実装 0 0% - -
TimeAffineで入力x(N,T,D)を語彙logits(N,T,V)へ写す代表的な実装は? スクラッチ実装 0 0% - -
TimeEmbedding.backwardは全時刻の埋め込み重み勾配をどう集約する? スクラッチ実装 0 0% - -
TimeEmbeddingのforwardは入力xs(N,T)をどう処理する? スクラッチ実装 0 0% - -
TimeLSTMの時刻tのbackwardへ渡す2つの勾配は? スクラッチ実装 0 0% - -
TimeRNNが時刻ごとのRNNレイヤをlayersへ保存する理由は? スクラッチ実装 0 0% - -
TimeRNNで共有パラメータの勾配を時刻ごとに上書きしてはいけない理由は? スクラッチ実装 0 0% - -
TimeRNNの時刻tのbackwardでRNNセルへ渡す上流勾配は? スクラッチ実装 0 0% - -
TimeRNNの時刻tのforwardでRNNセルへ渡す2つの値は? スクラッチ実装 0 0% - -
TimeSoftmaxWithLossでignore_labelを除いた平均損失はどう求める? スクラッチ実装 0 0% - -
AVILENのSimpleRNNClassifierでAffine重みとbiasのshapeは? テンソルshape 0 0% - -
K層・双方向LSTMが返す最終状態テンソルには、各サンプル当たり何組のhとcがある? テンソルshape 0 0% - -
PyTorch CTCLossのtargetsで利用できる2つの配置形式は? テンソルshape 0 0% - -
PyTorch CTCLossへ渡すlog_probsのbatched shapeは? テンソルshape 0 0% - -
PyTorch RNN系shapeの記号Dは何を表す? テンソルshape 0 0% - -
PyTorch RNN系へunbatched inputを渡した場合、batch_firstはshapeを変える? テンソルshape 0 0% - -
PyTorch RNN系モジュールでbatch_first=Falseのbatched input shapeは? テンソルshape 0 0% - -
PyTorch nn.GRUのweight_ih_l0とweight_hh_l0のshapeは? テンソルshape 0 0% - -
PyTorch nn.RNNのweight_ih_l0とweight_hh_l0のshapeは? テンソルshape 0 0% - -
PyTorch projected LSTMのweight_hr_l0のshapeは? テンソルshape 0 0% - -
PyTorchのbatch_first=Trueは何のshapeを変える? テンソルshape 0 0% - -
PyTorchのh_n(DK,N,H)で層l・方向dに対応するflat indexは? テンソルshape 0 0% - -
RNNセルでxが(N,I)、h_prevが(N,H)のときdtとdbのshapeは? テンソルshape 0 0% - -
batch_first=Trueのとき、h_nとc_nの先頭軸はバッチ軸になる? テンソルshape 0 0% - -
batch_first=Trueの双方向RNN output(N,T,2H)を方向別に見るreshapeは? テンソルshape 0 0% - -
batch_first=Trueの系列入力で、バッチN・系列長T・入力次元Iのshapeは? テンソルshape 0 0% - -
encoder状態がH_e次元なら、その重み付き和で作る標準Attention contextの次元は? テンソルshape 0 0% - -
f・i・g・oの4ブロック計算を一括する行ベクトル実装で、LSTMのW_x、W_h、bのshapeは? テンソルshape 0 0% - -
h_n(DK,N,H)から層・方向を明示するreshapeは? テンソルshape 0 0% - -
proj_size=0のPyTorch nn.LSTMでweight_ih_l0とweight_hh_l0のshapeは? テンソルshape 0 0% - -
proj_size=P>0のPyTorch LSTMでoutputの特徴次元は? テンソルshape 0 0% - -
proj_size=P>0のPyTorch LSTMで、h_nとc_nの最終次元は? テンソルshape 0 0% - -
projectionなしの双方向多層PyTorch RNN系で、2層目以降のweight_ihの第2次元は? テンソルshape 0 0% - -
projectionなし・batched inputのPyTorch LSTMで、c_nの一般shapeは? テンソルshape 0 0% - -
projectionなし・batched inputのPyTorch RNN/GRUで、h_nの一般shapeは? テンソルshape 0 0% - -
projectionなし・batched inputのPyTorch RNN系で、outputの一般shapeは? テンソルshape 0 0% - -
r・z・nの3ブロック計算を一括する行ベクトル実装で、GRUのW_x、W_h、bのshapeは? テンソルshape 0 0% - -
source長T_x、target長T_yのAttention重み行列をtarget×sourceで並べたshapeは? テンソルshape 0 0% - -
バッチN、入力次元I、隠れ次元Hで、1時刻のx_tとh_tのshapeは? テンソルshape 0 0% - -
入力次元I、隠れ次元Hの単純RNNで、W_xhのshapeは? テンソルshape 0 0% - -
入力次元I・隠れ次元Hの標準LSTMで、f・i・g・oの各ベクトルのshapeは? テンソルshape 0 0% - -
列ベクトル規約で入力I・隠れHのLSTMを連結入力から一括計算するWのshapeは? テンソルshape 0 0% - -
単方向RNNが全時刻の隠れ状態を返すとき、batch_first=Trueなら代表的なshapeは? テンソルshape 0 0% - -
各時刻へO次元の同じ出力headを適用した場合、batch_first=Trueのlogits shapeは? テンソルshape 0 0% - -
隠れ次元H、出力次元OのRNNで、列ベクトル式o_t=W_hy h_t+b_yのW_hyのshapeは? テンソルshape 0 0% - -
隠れ次元Hの単純RNNで、再帰重みW_hhのshapeは? テンソルshape 0 0% - -
1層・単方向・biasありPyTorch projected LSTMのパラメータ数は? パラメータ数 0 0% - -
I=10、H=20、P=8の1層PyTorch projected LSTMはbiasありで何パラメータ? パラメータ数 0 0% - -
I=5、H=7、K=2、双方向、biasありのPyTorch RNN・GRU・LSTMのパラメータ数は? パラメータ数 0 0% - -
I=5、H=7のPyTorch単純RNNに7→3のbiasありLinearを付けた総パラメータ数は? パラメータ数 0 0% - -
PyTorch RNN/LSTM/GRUがbias=Trueで各層・各方向に持つバイアスは何本? パラメータ数 0 0% - -
PyTorchの1層・単方向nn.GRUでbias=Trueのパラメータ数は? パラメータ数 0 0% - -
PyTorchの1層・単方向nn.LSTMでbias=Trueのパラメータ数は? パラメータ数 0 0% - -
PyTorchの1層・単方向nn.RNNでbias=Trueの場合、セル部分のパラメータ数は? パラメータ数 0 0% - -
projectionなしの標準PyTorch RNN系で、K層・D方向・biasあり総パラメータ数の一般式は? パラメータ数 0 0% - -
入力I=10、隠れH=20の1層・単方向nn.GRUはbias=Trueで何パラメータ? パラメータ数 0 0% - -
入力I=10、隠れH=20の1層・単方向nn.LSTMはbias=Trueで何パラメータ? パラメータ数 0 0% - -
入力I=5、隠れH=7の1層・単方向nn.RNNは、bias=Trueで何パラメータ? パラメータ数 0 0% - -
入力I=5、隠れH=7の単純RNNで、教科書式とPyTorch既定のパラメータ数の差は? パラメータ数 0 0% - -
入力I=5、隠れH=7の単純RNNセルは、単一バイアスの教科書式で何パラメータ? パラメータ数 0 0% - -
単一バイアスで数える1層・単方向GRUセルのパラメータ数は? パラメータ数 0 0% - -
単一バイアスで数える1層・単方向LSTMセルのパラメータ数は? パラメータ数 0 0% - -
同じI=10、H=20のPyTorch GRUとLSTMのセルパラメータ数の差は? パラメータ数 0 0% - -
教科書式の単純RNNセルでバイアスを1本と数える場合、入力I・隠れHのパラメータ数は? パラメータ数 0 0% - -
隠れ次元HからCクラスへ写すbiasありLinear headのパラメータ数は? パラメータ数 0 0% - -
AVILENのNumPy版clip_gradsで0除算を避ける代入式は? 勾配クリッピング 0 0% - -
AVILENのgradient_clipでi行目をクリップする条件と代入式は? 勾配クリッピング 0 0% - -
AVILENのgradient_clipでクリップ対象行の処理後L2ノルムは? 勾配クリッピング 0 0% - -
AVILENのgradient_clipで各勾配行のノルムを求めるコードは? 勾配クリッピング 0 0% - -
PyTorchのclip_grad_norm_は各行の勾配を個別にクリップする? 勾配クリッピング 0 0% - -
PyTorch学習で勾配クリッピングを行う基本順序は? 勾配クリッピング 0 0% - -
global norm clippingは勾配の向きを変える? 勾配クリッピング 0 0% - -
norm clippingとvalue clippingの違いは? 勾配クリッピング 0 0% - -
勾配クリッピングの主目的は? 勾配クリッピング 0 0% - -
勾配クリッピングはRNNの勾配消失を解決する? 勾配クリッピング 0 0% - -
勾配クリッピング式の分母にεを加える理由は? 勾配クリッピング 0 0% - -
勾配ノルムがクリッピング閾値以下ならどうする? 勾配クリッピング 0 0% - -
勾配ベクトルgのL2ノルムが閾値cを超えたときのnorm clipping式は? 勾配クリッピング 0 0% - -
1層双方向RNNの最終2方向をh_nから取得する添字は? 双方向RNN 0 0% - -
2方向を連結する双方向RNNの後段Linearは、入力次元を通常いくつにする? 双方向RNN 0 0% - -
Keras Bidirectionalのmerge_modeで選べる統合方法は? 双方向RNN 0 0% - -
Keras Bidirectionalへinitial_stateを渡すと各方向へどう分配される? 双方向RNN 0 0% - -
Keras Bidirectionalへ独自backward_layerを渡す際の主な整合条件は? 双方向RNN 0 0% - -
PyTorchの双方向RNNで各時刻のoutputは2方向をどう格納する? 双方向RNN 0 0% - -
PyTorch双方向LSTMの2方向の最終状態を分類用に結合するコードは? 双方向RNN 0 0% - -
双方向PyTorch LSTMの逆方向Parameterは名前でどう識別する? 双方向RNN 0 0% - -
双方向RNNが厳密なオンライン予測に不向きな理由は? 双方向RNN 0 0% - -
双方向RNNが各位置で利用できる文脈は? 双方向RNN 0 0% - -
双方向RNNが特に利用しやすいタスクは? 双方向RNN 0 0% - -
双方向RNNでoutput[:,-1,:]は両方向の「最終状態」を連結したもの? 双方向RNN 0 0% - -
双方向RNNとは? 双方向RNN 0 0% - -
双方向RNNの2方向の表現を統合する代表的な方法は? 双方向RNN 0 0% - -
双方向RNNの順方向と逆方向は同じ重みを共有する? 双方向RNN 0 0% - -
双方向RNNの順方向状態と逆方向状態は、時間方向の途中で直接相互接続される? 双方向RNN 0 0% - -
双方向RNNは単方向RNNと比べて計算量・パラメータ数がどうなる? 双方向RNN 0 0% - -
双方向RNNは可変長系列を処理できる? 双方向RNN 0 0% - -
双方向化だけで単純RNNの長期依存問題は必ず解決する? 双方向RNN 0 0% - -
各方向H次元の双方向RNN出力を要素加算すると、特徴次元は? 双方向RNN 0 0% - -
各方向のhidden_sizeがHの双方向RNNで、2方向を連結した各時刻の特徴次元は? 双方向RNN 0 0% - -
学習済みRNN layerをKeras Bidirectionalで包むと、その重みは再利用される? 双方向RNN 0 0% - -
将来の株価を予測する入力へ未来時点の値を使う双方向RNNは、何が問題? 双方向RNN 0 0% - -
Embeddingにpadding_idxを指定すれば、後段RNNもpadding時刻を自動的に無視する? 可変長系列 0 0% - -
Keras RNNのzero_output_for_maskが働く条件は? 可変長系列 0 0% - -
Keras RNNへ渡すmaskでTrueとFalseは何を意味する? 可変長系列 0 0% - -
PackedSequenceのbatch_sizesは各系列のlength一覧? 可変長系列 0 0% - -
PackedSequenceのdataとbatch_sizesは同じdeviceへ置く? 可変長系列 0 0% - -
PackedSequenceをRNNへ入力する主な目的は? 可変長系列 0 0% - -
PackedSequenceをコンストラクタから手作業で生成するのは推奨される? 可変長系列 0 0% - -
PyTorch pad_sequenceでpaddingを左側へ入れる指定は? 可変長系列 0 0% - -
RNN出力(N,T,H)へmask(N,T)を掛けるための代表的なshape変換は? 可変長系列 0 0% - -
enforce_sorted=Falseでpackした系列をpad_packed_sequenceで戻すとバッチ順は? 可変長系列 0 0% - -
maskが有効token=1、padding=0のとき、masked mean lossの式は? 可変長系列 0 0% - -
pack_padded_sequenceのenforce_sorted=Trueでは、系列をどう並べる? 可変長系列 0 0% - -
pack_padded_sequenceは入力特徴だけでなく系列ラベルもpackできる? 可変長系列 0 0% - -
pack_padded_sequenceへTensorで渡すlengthsは、どのdeviceに置く必要がある? 可変長系列 0 0% - -
pack_padded_sequenceへ実際より短いlengthsを渡すと余分な時刻はどうなる? 可変長系列 0 0% - -
pack_sequenceは概念的にどの2処理をまとめたAPI? 可変長系列 0 0% - -
pad_packed_sequenceのtotal_lengthは何に使う? 可変長系列 0 0% - -
pad_packed_sequenceは何を返す? 可変長系列 0 0% - -
可変長系列をpaddingする主な理由は? 可変長系列 0 0% - -
右paddingした可変長系列でout[:,-1,:]を系列表現にする問題は? 可変長系列 0 0% - -
右paddingした系列へ時間方向max poolingを行うとき、padding位置を0にするだけでは危険なのはなぜ? 可変長系列 0 0% - -
右paddingの出力out(N,T,H)から各系列の最終有効状態をgatherする時刻indexは? 可変長系列 0 0% - -
明示的なmaskでpadding位置をtoken損失から除外する場合、reductionはまず何にする? 可変長系列 0 0% - -
有効token mask m_(n,t)を使うRNN出力h_(n,t)のmasked mean pooling式は? 可変長系列 0 0% - -
長さ順に手動ソートしたバッチを元の順序へ戻す逆置換はどう作る? 可変長系列 0 0% - -
PyTorchのRNN/LSTM/GRUでdropout引数はどこに適用される? 多層RNN 0 0% - -
PyTorchのnum_layersと系列長Tは同じ意味? 多層RNN 0 0% - -
keras.layers.RNNへcellのリストを渡すとどうなる? 多層RNN 0 0% - -
num_layers=1のPyTorch RNNへdropout>0を指定すると、組込みdropoutは有効? 多層RNN 0 0% - -
双方向多層RNNで上位層の1時刻入力次元は、通常hidden_size Hの何倍? 多層RNN 0 0% - -
多層RNNで第2層が受け取るものは? 多層RNN 0 0% - -
多層RNN(stacked RNN)とは? 多層RNN 0 0% - -
多層化すればRNNの性能は必ず向上する? 多層RNN 0 0% - -
beam widthを1にしたbeam searchは何に相当する? 探索・デコーディング 0 0% - -
greedy decodingとbeam searchの違いは? 探索・デコーディング 0 0% - -
対数確率の単純和でbeam候補を比較すると短い系列へ偏りやすいのはなぜ? 探索・デコーディング 0 0% - -
Many-to-One型RNNの入出力例は? 系列入出力 0 0% - -
One-to-Many型RNNの入出力例は? 系列入出力 0 0% - -
RNNは各時刻で出力する構成と、系列を読み終えてから出力する構成の両方を作れる? 系列入出力 0 0% - -
RNNを用いた機械翻訳は、どのような系列変換として捉えられる? 系列入出力 0 0% - -
入力と出力の時刻が対応するMany-to-Many型RNNの例は? 系列入出力 0 0% - -
入力後に出力系列を生成するMany-to-Many型の代表構造は? 系列入出力 0 0% - -
画像キャプション生成でCNNとRNNを組み合わせる典型的な役割分担は? 系列入出力 0 0% - -
softmax temperature τを1未満にすると生成分布はどうなる? 系列生成 0 0% - -
top-k samplingとtop-p samplingの候補集合の違いは? 系列生成 0 0% - -
次トークン予測でtokens=[BOS,A,B,EOS]から作る入力と教師の代表例は? 系列生成 0 0% - -
自己回帰decoderが系列yの条件付き確率を分解する式は? 系列生成 0 0% - -
token単位の平均負の対数尤度をLとすると、perplexityは? 言語モデル 0 0% - -
RNNで時間ステップ間に共有されるものは? 重み共有 0 0% - -
RNNの状態遷移をtime-invariantと呼べるのはなぜ? 重み共有 0 0% - -
TimeRNNで時刻ごとに別なのはレイヤと学習パラメータ(params)のどちら? 重み共有 0 0% - -
同じRNNセルをT時刻へ展開すると、学習パラメータ数はT倍になる? 重み共有 0 0% - -
時間展開図に同じ記号Wが各時刻に描かれる意味は? 重み共有 0 0% - -
RNNで勾配爆発が疑われる代表的な兆候は? 長期依存性 0 0% - -
RNNにおける長期依存性とは? 長期依存性 0 0% - -
RNNの勾配消失とは? 長期依存性 0 0% - -
RNNの勾配爆発とは? 長期依存性 0 0% - -
RNNの活性化をReLUにすれば勾配消失を必ず防げる? 長期依存性 0 0% - -
sigmoidやtanhを使うRNNで勾配消失が起こりやすいのはなぜ? 長期依存性 0 0% - -
一定の忘却係数0<f<1に対する記憶の半減時刻kの近似式は? 長期依存性 0 0% - -
再帰重みW_hhのスペクトル半径だけでRNNの勾配消失・爆発を完全に判定できる? 長期依存性 0 0% - -
忘却ゲートが各時刻一定f=0.9で新規書込みを無視すると、10時刻後に残る割合は? 長期依存性 0 0% - -
時刻kからtへの単純RNNの勾配に現れる本質的な形は? 長期依存性 0 0% - -
時間方向Jacobianのノルムが継続的に1未満または1超なら、勾配はどうなりやすい? 長期依存性 0 0% - -
線形RNNで再帰行列の固有値の絶対値がすべて1未満なら、h_0の影響は一般にどうなる? 長期依存性 0 0% - -
線形RNNで初期状態h_0が時刻tの状態へ与える直接的な係数は? 長期依存性 0 0% - -