| 問題 | 論点 | 回答回数 | 正答率 | 最短秒 | 平均秒 |
| Attention context vectorの標準的な式は? |
Attention |
0 |
0% |
- |
- |
| Attentionであるサンプルの全source位置がmaskされた場合に注意すべきことは? |
Attention |
0 |
0% |
- |
- |
| Attentionのalignment score(energy)は何を表す? |
Attention |
0 |
0% |
- |
- |
| Attentionのcontext vectorはdecoderの全時刻で同じ? |
Attention |
0 |
0% |
- |
- |
| Attentionを使うモデルは必ずRNNを含む? |
Attention |
0 |
0% |
- |
- |
| Attention付きSeq2Seqは長文問題を完全に解決する? |
Attention |
0 |
0% |
- |
- |
| Attention機構がSeq2Seqへ導入された主な目的は? |
Attention |
0 |
0% |
- |
- |
| Attention重みのentropyが低い分布は、一般にどのような注目を表す? |
Attention |
0 |
0% |
- |
- |
| Global Attentionで全source・target位置のscoreを計算する個数は? |
Attention |
0 |
0% |
- |
- |
| Global Attentionとは? |
Attention |
0 |
0% |
- |
- |
| Hard Attentionとは? |
Attention |
0 |
0% |
- |
- |
| Local Attentionとは? |
Attention |
0 |
0% |
- |
- |
| Local Attentionの主な利点は? |
Attention |
0 |
0% |
- |
- |
| RNN encoder-decoderのsoft Attentionは、encoderの何を利用する? |
Attention |
0 |
0% |
- |
- |
| Soft Attentionが通常の誤差逆伝播で学習しやすい理由は? |
Attention |
0 |
0% |
- |
- |
| padding済みsourceへAttentionを行うとき、maskはsoftmaxの前と後のどちらへ入れるのが基本? |
Attention |
0 |
0% |
- |
- |
| soft Attentionの重みαをscoreから作る代表的な処理は? |
Attention |
0 |
0% |
- |
- |
| 加法型Attentionでencoder H_e、decoder H_d、attention内部A次元なら代表的なParameter shapeは? |
Attention |
0 |
0% |
- |
- |
| 素のdot-product Attentionでencoder状態とdecoder状態に必要な次元条件は? |
Attention |
0 |
0% |
- |
- |
| BPTTでh_tへ流れ込む勾配には、主にどの2種類がある? |
BPTT |
0 |
0% |
- |
- |
| BPTTで共有重みWの勾配は各時刻の寄与をどう扱う? |
BPTT |
0 |
0% |
- |
- |
| BPTTの数学的な基盤は? |
BPTT |
0 |
0% |
- |
- |
| BPTTはどの順序で隠れ状態の勾配を伝える? |
BPTT |
0 |
0% |
- |
- |
| BPTTは何の略で、何を行う手法? |
BPTT |
0 |
0% |
- |
- |
| Full BPTTのメモリ使用量が系列長とともに増える主な理由は? |
BPTT |
0 |
0% |
- |
- |
| RNNの隠れバイアスb_hへの勾配はどう求める? |
BPTT |
0 |
0% |
- |
- |
| TimeLSTMでBPTTを始めるときdhとdcをどう初期化・更新する? |
BPTT |
0 |
0% |
- |
- |
| TimeRNN.backward終了後のself.dhは何への勾配? |
BPTT |
0 |
0% |
- |
- |
| a_t=W_xh x_t+W_hh h_(t-1)+bのとき、h_(t-1)へ戻る局所勾配は? |
BPTT |
0 |
0% |
- |
- |
| h_t=tanh(a_t)の局所逆伝播は? |
BPTT |
0 |
0% |
- |
- |
| 列ベクトル表記でa_t=W_xh x_t+…のとき、W_xhへの局所勾配は? |
BPTT |
0 |
0% |
- |
- |
| 列ベクトル表記でa_t=…+W_hh h_(t-1)+bのとき、W_hhへの局所勾配は? |
BPTT |
0 |
0% |
- |
- |
| 列ベクトル表記でo_t=W_hy h_t+b_yのとき、W_hyへの局所勾配は? |
BPTT |
0 |
0% |
- |
- |
| 各時刻に損失L_tがあるRNNで、総損失L=Σ_t L_tならパラメータ勾配は? |
BPTT |
0 |
0% |
- |
- |
| 最終時刻だけに損失があるTimeRNNで、(N,H)の勾配を(N,T,H)へ配置するには? |
BPTT |
0 |
0% |
- |
- |
| 最終時刻だけに損失を置くRNNと全時刻に損失を置くRNNでは、直接の教師信号はどう違う? |
BPTT |
0 |
0% |
- |
- |
| 系列が長いとFull BPTTの計算時間が増える理由は? |
BPTT |
0 |
0% |
- |
- |
| 要素ごとの活性化h_t=φ(a_t)で、∂h_t/∂a_tのJacobianは? |
BPTT |
0 |
0% |
- |
- |
| CTC prefix beam searchがgreedy decodingより広く探索するものは? |
CTC |
0 |
0% |
- |
- |
| CTCLossのinput_lengthsは何を表す? |
CTC |
0 |
0% |
- |
- |
| CTCLossのtarget_lengthsは何を表す? |
CTC |
0 |
0% |
- |
- |
| CTCが明示的なフレーム単位alignment教師を必要としない理由は? |
CTC |
0 |
0% |
- |
- |
| CTCでtarget yの確率p(y|x)はどう求める? |
CTC |
0 |
0% |
- |
- |
| CTCでtargetの連続した同一文字「ll」を表すpathにblank等の区切りが必要なのはなぜ? |
CTC |
0 |
0% |
- |
- |
| CTCでtarget長Uに隣接同一ラベルがR組あるとき、必要な最小入力長の下限は? |
CTC |
0 |
0% |
- |
- |
| CTCのcollapse演算Bはpathへどの順で処理を行う? |
CTC |
0 |
0% |
- |
- |
| CTCのgreedy decodingの基本手順は? |
CTC |
0 |
0% |
- |
- |
| CTCのtarget系列にblankラベル自体を含めてよい? |
CTC |
0 |
0% |
- |
- |
| CTCの全alignment pathを素朴に列挙せず確率を求める代表的な方法は? |
CTC |
0 |
0% |
- |
- |
| CTCは何の略で、何を学習する損失? |
CTC |
0 |
0% |
- |
- |
| PyTorch CTCLossでreduction='mean'の平均方法は? |
CTC |
0 |
0% |
- |
- |
| PyTorch CTCLossのzero_infinity=Trueは何をする? |
CTC |
0 |
0% |
- |
- |
| PyTorch CTCLossへraw logitsをそのまま渡してよい? |
CTC |
0 |
0% |
- |
- |
| PyTorch nn.CTCLossの既定blankクラスindexは? |
CTC |
0 |
0% |
- |
- |
| 標準CTCが入力xを条件に仮定する出力時刻間の関係は? |
CTC |
0 |
0% |
- |
- |
| GRUが提案された主な狙いは? |
GRU |
0 |
0% |
- |
- |
| GRUにLSTMの出力ゲートに相当する独立ゲートはある? |
GRU |
0 |
0% |
- |
- |
| GRUにはセル状態がないので、過去情報を記憶できない? |
GRU |
0 |
0% |
- |
- |
| GRUのリセットゲートr_tの役割は? |
GRU |
0 |
0% |
- |
- |
| GRUのリセット・更新ゲートにsigmoidを使う理由は? |
GRU |
0 |
0% |
- |
- |
| GRUの候補隠れ状態にtanhを使う標準的な理由は? |
GRU |
0 |
0% |
- |
- |
| GRUの更新ゲートz_tの役割は? |
GRU |
0 |
0% |
- |
- |
| GRUの正式名称は? |
GRU |
0 |
0% |
- |
- |
| GRUはLSTMのような独立したセル状態c_tを持つ? |
GRU |
0 |
0% |
- |
- |
| GRUはLSTMより常に高速? |
GRU |
0 |
0% |
- |
- |
| GRUはMany-to-Oneの系列分類に使える? |
GRU |
0 |
0% |
- |
- |
| Keras GRUのreset_after=True版がbiasを2系統持つ理由は? |
GRU |
0 |
0% |
- |
- |
| PyTorch nn.GRUの戻り値h_nをr・z・nの3ゲートへ分解できる? |
GRU |
0 |
0% |
- |
- |
| Stateful GRUで次のチャンクへ渡す状態は? |
GRU |
0 |
0% |
- |
- |
| 標準GRUの2つのゲートは? |
GRU |
0 |
0% |
- |
- |
| 長期依存タスクではLSTMがGRUより常に高精度? |
GRU |
0 |
0% |
- |
- |
| AVILEN規約h_t=(1−z_t)h_(t-1)+z_t h̃_tで、z_t=0と1は何を意味する? |
GRUゲート |
0 |
0% |
- |
- |
| GRUでr_tが0に近いと、候補状態の計算はどうなる? |
GRUゲート |
0 |
0% |
- |
- |
| GRUでreset gateが0でも、最終h_tから過去状態の影響が必ず消えるとは限らないのはなぜ? |
GRUゲート |
0 |
0% |
- |
- |
| GRUの更新ゲートz_tは1つのスカラー? |
GRUゲート |
0 |
0% |
- |
- |
| PyTorch規約のGRUでz_t=0ならh_tはどうなる? |
GRUゲート |
0 |
0% |
- |
- |
| PyTorch規約のGRUでz_t=1ならh_tはどうなる? |
GRUゲート |
0 |
0% |
- |
- |
| AVILEN GRUのz・r・h_hatの順伝播式は? |
GRU数式 |
0 |
0% |
- |
- |
| AVILEN教材で使う逆規約のGRU更新式は? |
GRU数式 |
0 |
0% |
- |
- |
| GRUの候補状態でreset gateを掛ける位置は全実装で同じ? |
GRU数式 |
0 |
0% |
- |
- |
| Keras GRUのreset_after=Trueは何を意味する? |
GRU数式 |
0 |
0% |
- |
- |
| PyTorch規約h_t=(1−z_t)⊙n_t+z_t⊙h_prevで、z_tへの局所勾配は? |
GRU数式 |
0 |
0% |
- |
- |
| PyTorch規約のGRUでz=0.7、h_prev=0.4、候補n=−0.2ならh_tは? |
GRU数式 |
0 |
0% |
- |
- |
| PyTorch規約のGRUでリセットゲートr_tの式は? |
GRU数式 |
0 |
0% |
- |
- |
| PyTorch規約のGRUで候補状態n_tの式は? |
GRU数式 |
0 |
0% |
- |
- |
| PyTorch規約のGRUで更新ゲートz_tの式は? |
GRU数式 |
0 |
0% |
- |
- |
| PyTorch規約のGRUで隠れ状態h_tの更新式は? |
GRU数式 |
0 |
0% |
- |
- |
| CECとは何の略で、LSTMでは何を指す? |
LSTM |
0 |
0% |
- |
- |
| Keras LSTMのunit_forget_bias=Trueは初期化時に何をする? |
LSTM |
0 |
0% |
- |
- |
| LSTMが単純RNNに追加する中心的な状態は? |
LSTM |
0 |
0% |
- |
- |
| LSTMが単純RNNより勾配を保ちやすい中心的な構造は? |
LSTM |
0 |
0% |
- |
- |
| LSTMのh_tとc_tの役割の違いは? |
LSTM |
0 |
0% |
- |
- |
| LSTMの忘却ゲートbiasを正の値で初期化する狙いは? |
LSTM |
0 |
0% |
- |
- |
| LSTMは何の略で、何を改善するためのモデル? |
LSTM |
0 |
0% |
- |
- |
| LSTMは勾配消失を完全に防ぐ? |
LSTM |
0 |
0% |
- |
- |
| Peephole LSTMの出力ゲートは、一般的にどのセル状態を参照する? |
LSTM |
0 |
0% |
- |
- |
| Peephole connection付きLSTMとは? |
LSTM |
0 |
0% |
- |
- |
| PyTorch nn.LSTMでproj_sizeにhidden_size以上を指定できる? |
LSTM |
0 |
0% |
- |
- |
| PyTorch nn.LSTMのゲート格納順と、AVILENスクラッチ教材の例の順序は? |
LSTM |
0 |
0% |
- |
- |
| PyTorchのLSTM projectionとは? |
LSTM |
0 |
0% |
- |
- |
| PyTorchの標準nn.LSTMはpeephole connectionを引数1つで有効化できる? |
LSTM |
0 |
0% |
- |
- |
| Stateful LSTMで次のチャンクへ持ち越すべき状態は? |
LSTM |
0 |
0% |
- |
- |
| 他の間接経路を除くと、LSTMのセル経路で∂c_t/∂c_(t-1)は何? |
LSTM |
0 |
0% |
- |
- |
| 同じI・Hなら、標準LSTMは単純RNNよりセル計算とパラメータが多いのはなぜ? |
LSTM |
0 |
0% |
- |
- |
| 標準LSTMのセル状態c_tは必ず[-1,1]に収まる? |
LSTM |
0 |
0% |
- |
- |
| LSTMでf=1、i=1ならセル状態は必ず保持されるだけ? |
LSTMゲート |
0 |
0% |
- |
- |
| LSTMでf_t=0なら、前のセル状態の直接項はどうなる? |
LSTMゲート |
0 |
0% |
- |
- |
| LSTMでf_t=1、i_t=0ならc_tはどうなる? |
LSTMゲート |
0 |
0% |
- |
- |
| LSTMでo_t=0なら、セル状態c_tも消える? |
LSTMゲート |
0 |
0% |
- |
- |
| LSTMの候補セルg_tにtanhを使う理由は? |
LSTMゲート |
0 |
0% |
- |
- |
| LSTMの候補セルg_tは何を表す? |
LSTMゲート |
0 |
0% |
- |
- |
| LSTMの入力ゲートi_tの役割は? |
LSTMゲート |
0 |
0% |
- |
- |
| LSTMの出力ゲートo_tの役割は? |
LSTMゲート |
0 |
0% |
- |
- |
| LSTMの忘却ゲートf_tの役割は? |
LSTMゲート |
0 |
0% |
- |
- |
| LSTMの忘却・入力・出力ゲートにsigmoidを使う理由は? |
LSTMゲート |
0 |
0% |
- |
- |
| 標準LSTMの3つのゲートは? |
LSTMゲート |
0 |
0% |
- |
- |
| LSTMでf=0.8、i=0.25、g=0.4、c_prev=0.5の1要素についてc_tは? |
LSTM数式 |
0 |
0% |
- |
- |
| LSTMの4ブロックを連結入力q_t=[x_t;h_(t-1)]から一括計算する式は? |
LSTM数式 |
0 |
0% |
- |
- |
| LSTMのセル状態c_tの更新式は? |
LSTM数式 |
0 |
0% |
- |
- |
| LSTMの候補セルの標準式は? |
LSTM数式 |
0 |
0% |
- |
- |
| LSTMの入力ゲートの標準式は? |
LSTM数式 |
0 |
0% |
- |
- |
| LSTMの出力ゲートの標準式は? |
LSTM数式 |
0 |
0% |
- |
- |
| LSTMの忘却ゲートの標準式は? |
LSTM数式 |
0 |
0% |
- |
- |
| LSTMの隠れ状態h_tの更新式は? |
LSTM数式 |
0 |
0% |
- |
- |
| LSTM式の⊙は何を表す? |
LSTM数式 |
0 |
0% |
- |
- |
| 前問のc_t=0.5で出力ゲートo=0.6ならh_tは? |
LSTM数式 |
0 |
0% |
- |
- |
| AVILENのPyTorch双方向LSTMを生成するコードは? |
PyTorch実装 |
0 |
0% |
- |
- |
| AVILENの双方向LSTM分類でCrossEntropyLossへ返すべき値は? |
PyTorch実装 |
0 |
0% |
- |
- |
| PyTorch RNN系のoutputとh_nの内容の違いは? |
PyTorch実装 |
0 |
0% |
- |
- |
| PyTorchでtag_space.squeeze()を無条件に使う危険は? |
PyTorch実装 |
0 |
0% |
- |
- |
| PyTorchで単純RNN層を作る基本形は? |
PyTorch実装 |
0 |
0% |
- |
- |
| PyTorchのnn.GRUは何を返す? |
PyTorch実装 |
0 |
0% |
- |
- |
| PyTorchのnn.LSTMは何を返す? |
PyTorch実装 |
0 |
0% |
- |
- |
| PyTorchのnn.RNNは何を返す? |
PyTorch実装 |
0 |
0% |
- |
- |
| hidden_size=Hの双方向LSTMから2クラス分類するLinearは? |
PyTorch実装 |
0 |
0% |
- |
- |
| nn.CrossEntropyLossへRNN分類headの出力を渡す前にsoftmaxする? |
PyTorch実装 |
0 |
0% |
- |
- |
| num_layers=3のnn.RNNのoutputは3層すべての全時刻出力を含む? |
PyTorch実装 |
0 |
0% |
- |
- |
| projectionなし・batched inputのPyTorch RNN系で、初期状態を省略または明示する際の注意は? |
PyTorch実装 |
0 |
0% |
- |
- |
| 多層・双方向RNNのh_nは何を含む? |
PyTorch実装 |
0 |
0% |
- |
- |
| 最終ミニバッチを常にreshape(batch_size,C)すると何が起こり得る? |
PyTorch実装 |
0 |
0% |
- |
- |
| RNNが系列長方向の完全な並列計算をしにくい理由は? |
RNN基礎 |
0 |
0% |
- |
- |
| RNNのループを時間方向に展開する目的は? |
RNN基礎 |
0 |
0% |
- |
- |
| RNNの代表的な応用分野は? |
RNN基礎 |
0 |
0% |
- |
- |
| RNNの初期隠れ状態h_0には何を使う? |
RNN基礎 |
0 |
0% |
- |
- |
| RNNの隠れ状態h_tはクラス確率そのもの? |
RNN基礎 |
0 |
0% |
- |
- |
| RNNの隠れ状態h_tは何を表す? |
RNN基礎 |
0 |
0% |
- |
- |
| RNNは何の略で、どのようなデータを扱うためのニューラルネットワーク? |
RNN基礎 |
0 |
0% |
- |
- |
| RNNは画像内の文字を扱う用途には使えない? |
RNN基礎 |
0 |
0% |
- |
- |
| RNN・LSTM・GRUのうち、常に最も高精度なモデルは決まっている? |
RNN基礎 |
0 |
0% |
- |
- |
| Stateful RNNとStateless RNNの違いは? |
RNN基礎 |
0 |
0% |
- |
- |
| ミニバッチ内の系列サンプル順をshuffleすることと、各系列内の時刻順をshuffleすることは同じ? |
RNN基礎 |
0 |
0% |
- |
- |
| 全結合型の順伝播ネットワークとRNNの中心的な違いは? |
RNN基礎 |
0 |
0% |
- |
- |
| 単方向RNNの時刻tの出力は、通常どこまでの入力を利用する? |
RNN基礎 |
0 |
0% |
- |
- |
| 単純RNNの順伝播計算量は系列長Tに対して概ねどう増える? |
RNN基礎 |
0 |
0% |
- |
- |
| 単純RNNは時刻tの隠れ状態を何から更新する? |
RNN基礎 |
0 |
0% |
- |
- |
| 単純RNNは理論上、長さの異なる系列を処理できる? |
RNN基礎 |
0 |
0% |
- |
- |
| 同じ入力要素x_tでもRNNの出力が文脈によって変わるのはなぜ? |
RNN基礎 |
0 |
0% |
- |
- |
| 因果的な系列モデルの時刻tの予測に入力x_(t+1)を使ってよい? |
RNN基礎 |
0 |
0% |
- |
- |
| 独立した系列の間で隠れ状態を誤って持ち越すと何が起こる? |
RNN基礎 |
0 |
0% |
- |
- |
| 系列データとは? |
RNN基礎 |
0 |
0% |
- |
- |
| 系列データの順序を無作為に並べ替えると、一般に何が失われる? |
RNN基礎 |
0 |
0% |
- |
- |
| 音声認識でRNNが利用できる理由は? |
RNN基礎 |
0 |
0% |
- |
- |
| RNNでa_t=W_xh x_t+W_hh h_(t-1)+b_hと置いたとき、a_tは何? |
RNN数式 |
0 |
0% |
- |
- |
| RNNの出力層に使う活性化関数は常にsoftmax? |
RNN数式 |
0 |
0% |
- |
- |
| RNNの隠れ状態から時刻tの出力を求める基本式は? |
RNN数式 |
0 |
0% |
- |
- |
| h_tを求める式の右辺にh_t自身をそのまま置くのが不適切なのはなぜ? |
RNN数式 |
0 |
0% |
- |
- |
| 単純RNNでtanhが隠れ活性化に使われる理由と限界は? |
RNN数式 |
0 |
0% |
- |
- |
| 単純RNNの隠れ状態を求める標準的な式は? |
RNN数式 |
0 |
0% |
- |
- |
| 時刻tのRNN更新にx_(t-1)だけを使う式が不適切なのはなぜ? |
RNN数式 |
0 |
0% |
- |
- |
| 線形RNN h_t=W_hh h_(t-1)+W_xh x_tで、h_tを初期状態と入力列に展開すると? |
RNN数式 |
0 |
0% |
- |
- |
| 語彙数Vの次トークン予測でsoftmaxは何に対して適用する? |
RNN数式 |
0 |
0% |
- |
- |
| GNMTは何の略? |
Seq2Seq |
0 |
0% |
- |
- |
| Seq2Seq decoderの生成開始を知らせる代表的な特殊トークンは? |
Seq2Seq |
0 |
0% |
- |
- |
| Seq2Seq decoderは通常、何を合図に生成を終了する? |
Seq2Seq |
0 |
0% |
- |
- |
| Seq2Seqとは? |
Seq2Seq |
0 |
0% |
- |
- |
| Seq2Seqのdecoderの役割は? |
Seq2Seq |
0 |
0% |
- |
- |
| Seq2Seqのencoderの役割は? |
Seq2Seq |
0 |
0% |
- |
- |
| Seq2Seqの入力系列長と出力系列長は固定で同じである必要がある? |
Seq2Seq |
0 |
0% |
- |
- |
| encoderの最終状態次元とdecoderの初期状態次元が異なる場合の代表的な接続方法は? |
Seq2Seq |
0 |
0% |
- |
- |
| 古典的Seq2Seqで入力系列を反転する工夫の狙いは? |
Seq2Seq |
0 |
0% |
- |
- |
| 古典的なAttentionなしSeq2Seqの固定長context bottleneckとは? |
Seq2Seq |
0 |
0% |
- |
- |
| 自己回帰的decoderとは? |
Seq2Seq |
0 |
0% |
- |
- |
| TBPTTで区間境界の隠れ状態をdetachする目的は? |
TBPTT |
0 |
0% |
- |
- |
| TBPTTで状態をdetachすることと、状態を0へリセットすることの違いは? |
TBPTT |
0 |
0% |
- |
- |
| TBPTTとは? |
TBPTT |
0 |
0% |
- |
- |
| TBPTTの切断長を短くする主なトレードオフは? |
TBPTT |
0 |
0% |
- |
- |
| zero_grad()とRNN状態のdetach()は同じ役割? |
TBPTT |
0 |
0% |
- |
- |
| 長い系列をチャンクに分けるだけで、detachしなければTBPTTになる? |
TBPTT |
0 |
0% |
- |
- |
| Teacher Forcingとは? |
Teacher Forcing |
0 |
0% |
- |
- |
| Teacher Forcingに関連するexposure biasとは? |
Teacher Forcing |
0 |
0% |
- |
- |
| decoder入力とtargetを1トークンずらす理由は? |
Teacher Forcing |
0 |
0% |
- |
- |
| Keras Denseのunitsは何を表す? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| Keras GRUのreturn_state=Trueで返るstateは内部ゲート値? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| Keras LSTMがTensorFlow backendでcuDNN実装を使う代表的な条件は? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| Keras LSTMとGRUでreturn_state=Trueにしたとき、stateの個数はどう違う? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| Keras RNNに保持された実行状態を明示的に消すメソッドは? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| Keras RNN層のreturn_sequences=TrueとFalseの違いは? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| Keras RNN系でunroll=Trueにする主なトレードオフは? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| Keras RNN系のdropoutとrecurrent_dropoutの違いは? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| Keras stateful RNNで固定batch_sizeが必要なのはなぜ? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| Keras stateful RNNで連続バッチ間に必要なサンプル対応は? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| Keras stateful RNNをfitするときshuffleは通常どう設定する? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| KerasでLSTM(units)とRNN(LSTMCell(units))は性能実装上も常に同じ? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| Kerasでtoken単位損失を明示mask付き平均にする手順は? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| Kerasで真の双方向SimpleRNNを作る基本形は? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| Kerasのstateful RNNが保持するstatesはlayer weightsに含まれる? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| Kerasの独自RNN cellがcallで返す基本的な2要素は? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| Keras独自RNN cellのstate_sizeとoutput_sizeは何を定義する? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| TensorFlowでmask(N,T)をRNN出力(N,T,H)へ掛けるshape変換は? |
TensorFlow・Keras |
0 |
0% |
- |
- |
| Leaky unitでαが0に近いと、過去情報はどうなる? |
スキップ・Leaky接続 |
0 |
0% |
- |
- |
| Leaky unitでαが1に近いと、記憶の時間スケールはどうなる? |
スキップ・Leaky接続 |
0 |
0% |
- |
- |
| Leaky係数αはどのように決められる? |
スキップ・Leaky接続 |
0 |
0% |
- |
- |
| RNNのLeaky unitの代表的な更新式は? |
スキップ・Leaky接続 |
0 |
0% |
- |
- |
| 時間方向skip connectionを入れれば長期依存性と勾配爆発は必ず解決する? |
スキップ・Leaky接続 |
0 |
0% |
- |
- |
| 時間方向のskip connectionをRNNへ入れる狙いは? |
スキップ・Leaky接続 |
0 |
0% |
- |
- |
| AVILEN GRUでリセットゲート出力rへの勾配drは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN GRUで候補状態pre-activationへの勾配dtは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN GRUで更新ゲート出力zへの勾配dzは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN GRUで結合勾配dWx・dWhを復元する順序は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN GRUのdh_prevへ合流する主な経路は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN GRUのdxはどの経路の和になる? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN GRUのリセットゲートでdt・dWhr・dWxrは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN GRUの候補経路でdhrとdh_prevへの寄与は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN GRUの更新ゲートでdt・dWhz・dWxzは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN GRUの結合重みWx・Whを分割する順序は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN LSTMで各ブロックのpre-activation勾配は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN LSTMのbackwardでdAを連結する順序は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN LSTMの一括pre-activation Aをf・g・i・oへ分けるsliceは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN LSTMセルのdWx・dWh・dbは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN LSTMセルのdxとdh_prevは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN TimeAffine.backwardのdW・db・dxは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN TimeGRUのWx・Whの初期化式は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN TimeLSTM.backwardへ(N,H)の勾配だけ渡すとどうする? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN TimeLSTMでstateful=Falseならforward開始時のhとcは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN TimeLSTMのXavier型初期化でWx・Wh・bをどう作る? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN TimeLSTMのreset_stateは何をリセットする? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN TimeRNNでstateful=Falseならforward開始時のhは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN TimeRNNのWx・Wh・bの初期化式は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN TimeSoftmaxWithLoss.backwardの基本式と出力shapeは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN TimeSoftmaxWithLossがone-hot教師ts(N,T,V)を受けたときの処理は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILENのRNNセルはforward時にcacheへ何を保存する? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILENのRNNセル逆伝播で、dWhとdWxを求める式は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILENのRNNセル逆伝播で、dx・dh_prev・dbを求める式は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILENのTimeGRUスクラッチ実装はバイアスParameterを持つ? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILENの学習ループがSimpleRNNClassifierへ渡すxsの実際のshapeは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILENの系列二値分類器はTimeRNNのどの出力をAffineへ渡す? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILENの行ベクトルRNNセルで、順伝播のpre-activation tを実装する式は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILENスクラッチGRUで、候補状態の再帰重みWhへの勾配dWhは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILENスクラッチLSTMで、セル状態の分岐を合流した勾配dsは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILENスクラッチLSTMで、前セル状態へ戻す勾配dc_prevは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILENスクラッチLSTMで、活性化微分前のdi・df・do・dgは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN問4のSimpleRNNClassifierでloss_layerとrnn_layerは? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILEN規約h_next=z*h_hat+(1-z)*h_prevの直接勾配分岐は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| Embedding.backwardで同じ単語IDが複数回現れる場合、重み勾配をどう集約する? |
スクラッチ実装 |
0 |
0% |
- |
- |
| TimeAffineで入力x(N,T,D)を語彙logits(N,T,V)へ写す代表的な実装は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| TimeEmbedding.backwardは全時刻の埋め込み重み勾配をどう集約する? |
スクラッチ実装 |
0 |
0% |
- |
- |
| TimeEmbeddingのforwardは入力xs(N,T)をどう処理する? |
スクラッチ実装 |
0 |
0% |
- |
- |
| TimeLSTMの時刻tのbackwardへ渡す2つの勾配は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| TimeRNNが時刻ごとのRNNレイヤをlayersへ保存する理由は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| TimeRNNで共有パラメータの勾配を時刻ごとに上書きしてはいけない理由は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| TimeRNNの時刻tのbackwardでRNNセルへ渡す上流勾配は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| TimeRNNの時刻tのforwardでRNNセルへ渡す2つの値は? |
スクラッチ実装 |
0 |
0% |
- |
- |
| TimeSoftmaxWithLossでignore_labelを除いた平均損失はどう求める? |
スクラッチ実装 |
0 |
0% |
- |
- |
| AVILENのSimpleRNNClassifierでAffine重みとbiasのshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| K層・双方向LSTMが返す最終状態テンソルには、各サンプル当たり何組のhとcがある? |
テンソルshape |
0 |
0% |
- |
- |
| PyTorch CTCLossのtargetsで利用できる2つの配置形式は? |
テンソルshape |
0 |
0% |
- |
- |
| PyTorch CTCLossへ渡すlog_probsのbatched shapeは? |
テンソルshape |
0 |
0% |
- |
- |
| PyTorch RNN系shapeの記号Dは何を表す? |
テンソルshape |
0 |
0% |
- |
- |
| PyTorch RNN系へunbatched inputを渡した場合、batch_firstはshapeを変える? |
テンソルshape |
0 |
0% |
- |
- |
| PyTorch RNN系モジュールでbatch_first=Falseのbatched input shapeは? |
テンソルshape |
0 |
0% |
- |
- |
| PyTorch nn.GRUのweight_ih_l0とweight_hh_l0のshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| PyTorch nn.RNNのweight_ih_l0とweight_hh_l0のshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| PyTorch projected LSTMのweight_hr_l0のshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| PyTorchのbatch_first=Trueは何のshapeを変える? |
テンソルshape |
0 |
0% |
- |
- |
| PyTorchのh_n(DK,N,H)で層l・方向dに対応するflat indexは? |
テンソルshape |
0 |
0% |
- |
- |
| RNNセルでxが(N,I)、h_prevが(N,H)のときdtとdbのshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| batch_first=Trueのとき、h_nとc_nの先頭軸はバッチ軸になる? |
テンソルshape |
0 |
0% |
- |
- |
| batch_first=Trueの双方向RNN output(N,T,2H)を方向別に見るreshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| batch_first=Trueの系列入力で、バッチN・系列長T・入力次元Iのshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| encoder状態がH_e次元なら、その重み付き和で作る標準Attention contextの次元は? |
テンソルshape |
0 |
0% |
- |
- |
| f・i・g・oの4ブロック計算を一括する行ベクトル実装で、LSTMのW_x、W_h、bのshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| h_n(DK,N,H)から層・方向を明示するreshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| proj_size=0のPyTorch nn.LSTMでweight_ih_l0とweight_hh_l0のshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| proj_size=P>0のPyTorch LSTMでoutputの特徴次元は? |
テンソルshape |
0 |
0% |
- |
- |
| proj_size=P>0のPyTorch LSTMで、h_nとc_nの最終次元は? |
テンソルshape |
0 |
0% |
- |
- |
| projectionなしの双方向多層PyTorch RNN系で、2層目以降のweight_ihの第2次元は? |
テンソルshape |
0 |
0% |
- |
- |
| projectionなし・batched inputのPyTorch LSTMで、c_nの一般shapeは? |
テンソルshape |
0 |
0% |
- |
- |
| projectionなし・batched inputのPyTorch RNN/GRUで、h_nの一般shapeは? |
テンソルshape |
0 |
0% |
- |
- |
| projectionなし・batched inputのPyTorch RNN系で、outputの一般shapeは? |
テンソルshape |
0 |
0% |
- |
- |
| r・z・nの3ブロック計算を一括する行ベクトル実装で、GRUのW_x、W_h、bのshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| source長T_x、target長T_yのAttention重み行列をtarget×sourceで並べたshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| バッチN、入力次元I、隠れ次元Hで、1時刻のx_tとh_tのshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| 入力次元I、隠れ次元Hの単純RNNで、W_xhのshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| 入力次元I・隠れ次元Hの標準LSTMで、f・i・g・oの各ベクトルのshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| 列ベクトル規約で入力I・隠れHのLSTMを連結入力から一括計算するWのshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| 単方向RNNが全時刻の隠れ状態を返すとき、batch_first=Trueなら代表的なshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| 各時刻へO次元の同じ出力headを適用した場合、batch_first=Trueのlogits shapeは? |
テンソルshape |
0 |
0% |
- |
- |
| 隠れ次元H、出力次元OのRNNで、列ベクトル式o_t=W_hy h_t+b_yのW_hyのshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| 隠れ次元Hの単純RNNで、再帰重みW_hhのshapeは? |
テンソルshape |
0 |
0% |
- |
- |
| 1層・単方向・biasありPyTorch projected LSTMのパラメータ数は? |
パラメータ数 |
0 |
0% |
- |
- |
| I=10、H=20、P=8の1層PyTorch projected LSTMはbiasありで何パラメータ? |
パラメータ数 |
0 |
0% |
- |
- |
| I=5、H=7、K=2、双方向、biasありのPyTorch RNN・GRU・LSTMのパラメータ数は? |
パラメータ数 |
0 |
0% |
- |
- |
| I=5、H=7のPyTorch単純RNNに7→3のbiasありLinearを付けた総パラメータ数は? |
パラメータ数 |
0 |
0% |
- |
- |
| PyTorch RNN/LSTM/GRUがbias=Trueで各層・各方向に持つバイアスは何本? |
パラメータ数 |
0 |
0% |
- |
- |
| PyTorchの1層・単方向nn.GRUでbias=Trueのパラメータ数は? |
パラメータ数 |
0 |
0% |
- |
- |
| PyTorchの1層・単方向nn.LSTMでbias=Trueのパラメータ数は? |
パラメータ数 |
0 |
0% |
- |
- |
| PyTorchの1層・単方向nn.RNNでbias=Trueの場合、セル部分のパラメータ数は? |
パラメータ数 |
0 |
0% |
- |
- |
| projectionなしの標準PyTorch RNN系で、K層・D方向・biasあり総パラメータ数の一般式は? |
パラメータ数 |
0 |
0% |
- |
- |
| 入力I=10、隠れH=20の1層・単方向nn.GRUはbias=Trueで何パラメータ? |
パラメータ数 |
0 |
0% |
- |
- |
| 入力I=10、隠れH=20の1層・単方向nn.LSTMはbias=Trueで何パラメータ? |
パラメータ数 |
0 |
0% |
- |
- |
| 入力I=5、隠れH=7の1層・単方向nn.RNNは、bias=Trueで何パラメータ? |
パラメータ数 |
0 |
0% |
- |
- |
| 入力I=5、隠れH=7の単純RNNで、教科書式とPyTorch既定のパラメータ数の差は? |
パラメータ数 |
0 |
0% |
- |
- |
| 入力I=5、隠れH=7の単純RNNセルは、単一バイアスの教科書式で何パラメータ? |
パラメータ数 |
0 |
0% |
- |
- |
| 単一バイアスで数える1層・単方向GRUセルのパラメータ数は? |
パラメータ数 |
0 |
0% |
- |
- |
| 単一バイアスで数える1層・単方向LSTMセルのパラメータ数は? |
パラメータ数 |
0 |
0% |
- |
- |
| 同じI=10、H=20のPyTorch GRUとLSTMのセルパラメータ数の差は? |
パラメータ数 |
0 |
0% |
- |
- |
| 教科書式の単純RNNセルでバイアスを1本と数える場合、入力I・隠れHのパラメータ数は? |
パラメータ数 |
0 |
0% |
- |
- |
| 隠れ次元HからCクラスへ写すbiasありLinear headのパラメータ数は? |
パラメータ数 |
0 |
0% |
- |
- |
| AVILENのNumPy版clip_gradsで0除算を避ける代入式は? |
勾配クリッピング |
0 |
0% |
- |
- |
| AVILENのgradient_clipでi行目をクリップする条件と代入式は? |
勾配クリッピング |
0 |
0% |
- |
- |
| AVILENのgradient_clipでクリップ対象行の処理後L2ノルムは? |
勾配クリッピング |
0 |
0% |
- |
- |
| AVILENのgradient_clipで各勾配行のノルムを求めるコードは? |
勾配クリッピング |
0 |
0% |
- |
- |
| PyTorchのclip_grad_norm_は各行の勾配を個別にクリップする? |
勾配クリッピング |
0 |
0% |
- |
- |
| PyTorch学習で勾配クリッピングを行う基本順序は? |
勾配クリッピング |
0 |
0% |
- |
- |
| global norm clippingは勾配の向きを変える? |
勾配クリッピング |
0 |
0% |
- |
- |
| norm clippingとvalue clippingの違いは? |
勾配クリッピング |
0 |
0% |
- |
- |
| 勾配クリッピングの主目的は? |
勾配クリッピング |
0 |
0% |
- |
- |
| 勾配クリッピングはRNNの勾配消失を解決する? |
勾配クリッピング |
0 |
0% |
- |
- |
| 勾配クリッピング式の分母にεを加える理由は? |
勾配クリッピング |
0 |
0% |
- |
- |
| 勾配ノルムがクリッピング閾値以下ならどうする? |
勾配クリッピング |
0 |
0% |
- |
- |
| 勾配ベクトルgのL2ノルムが閾値cを超えたときのnorm clipping式は? |
勾配クリッピング |
0 |
0% |
- |
- |
| 1層双方向RNNの最終2方向をh_nから取得する添字は? |
双方向RNN |
0 |
0% |
- |
- |
| 2方向を連結する双方向RNNの後段Linearは、入力次元を通常いくつにする? |
双方向RNN |
0 |
0% |
- |
- |
| Keras Bidirectionalのmerge_modeで選べる統合方法は? |
双方向RNN |
0 |
0% |
- |
- |
| Keras Bidirectionalへinitial_stateを渡すと各方向へどう分配される? |
双方向RNN |
0 |
0% |
- |
- |
| Keras Bidirectionalへ独自backward_layerを渡す際の主な整合条件は? |
双方向RNN |
0 |
0% |
- |
- |
| PyTorchの双方向RNNで各時刻のoutputは2方向をどう格納する? |
双方向RNN |
0 |
0% |
- |
- |
| PyTorch双方向LSTMの2方向の最終状態を分類用に結合するコードは? |
双方向RNN |
0 |
0% |
- |
- |
| 双方向PyTorch LSTMの逆方向Parameterは名前でどう識別する? |
双方向RNN |
0 |
0% |
- |
- |
| 双方向RNNが厳密なオンライン予測に不向きな理由は? |
双方向RNN |
0 |
0% |
- |
- |
| 双方向RNNが各位置で利用できる文脈は? |
双方向RNN |
0 |
0% |
- |
- |
| 双方向RNNが特に利用しやすいタスクは? |
双方向RNN |
0 |
0% |
- |
- |
| 双方向RNNでoutput[:,-1,:]は両方向の「最終状態」を連結したもの? |
双方向RNN |
0 |
0% |
- |
- |
| 双方向RNNとは? |
双方向RNN |
0 |
0% |
- |
- |
| 双方向RNNの2方向の表現を統合する代表的な方法は? |
双方向RNN |
0 |
0% |
- |
- |
| 双方向RNNの順方向と逆方向は同じ重みを共有する? |
双方向RNN |
0 |
0% |
- |
- |
| 双方向RNNの順方向状態と逆方向状態は、時間方向の途中で直接相互接続される? |
双方向RNN |
0 |
0% |
- |
- |
| 双方向RNNは単方向RNNと比べて計算量・パラメータ数がどうなる? |
双方向RNN |
0 |
0% |
- |
- |
| 双方向RNNは可変長系列を処理できる? |
双方向RNN |
0 |
0% |
- |
- |
| 双方向化だけで単純RNNの長期依存問題は必ず解決する? |
双方向RNN |
0 |
0% |
- |
- |
| 各方向H次元の双方向RNN出力を要素加算すると、特徴次元は? |
双方向RNN |
0 |
0% |
- |
- |
| 各方向のhidden_sizeがHの双方向RNNで、2方向を連結した各時刻の特徴次元は? |
双方向RNN |
0 |
0% |
- |
- |
| 学習済みRNN layerをKeras Bidirectionalで包むと、その重みは再利用される? |
双方向RNN |
0 |
0% |
- |
- |
| 将来の株価を予測する入力へ未来時点の値を使う双方向RNNは、何が問題? |
双方向RNN |
0 |
0% |
- |
- |
| Embeddingにpadding_idxを指定すれば、後段RNNもpadding時刻を自動的に無視する? |
可変長系列 |
0 |
0% |
- |
- |
| Keras RNNのzero_output_for_maskが働く条件は? |
可変長系列 |
0 |
0% |
- |
- |
| Keras RNNへ渡すmaskでTrueとFalseは何を意味する? |
可変長系列 |
0 |
0% |
- |
- |
| PackedSequenceのbatch_sizesは各系列のlength一覧? |
可変長系列 |
0 |
0% |
- |
- |
| PackedSequenceのdataとbatch_sizesは同じdeviceへ置く? |
可変長系列 |
0 |
0% |
- |
- |
| PackedSequenceをRNNへ入力する主な目的は? |
可変長系列 |
0 |
0% |
- |
- |
| PackedSequenceをコンストラクタから手作業で生成するのは推奨される? |
可変長系列 |
0 |
0% |
- |
- |
| PyTorch pad_sequenceでpaddingを左側へ入れる指定は? |
可変長系列 |
0 |
0% |
- |
- |
| RNN出力(N,T,H)へmask(N,T)を掛けるための代表的なshape変換は? |
可変長系列 |
0 |
0% |
- |
- |
| enforce_sorted=Falseでpackした系列をpad_packed_sequenceで戻すとバッチ順は? |
可変長系列 |
0 |
0% |
- |
- |
| maskが有効token=1、padding=0のとき、masked mean lossの式は? |
可変長系列 |
0 |
0% |
- |
- |
| pack_padded_sequenceのenforce_sorted=Trueでは、系列をどう並べる? |
可変長系列 |
0 |
0% |
- |
- |
| pack_padded_sequenceは入力特徴だけでなく系列ラベルもpackできる? |
可変長系列 |
0 |
0% |
- |
- |
| pack_padded_sequenceへTensorで渡すlengthsは、どのdeviceに置く必要がある? |
可変長系列 |
0 |
0% |
- |
- |
| pack_padded_sequenceへ実際より短いlengthsを渡すと余分な時刻はどうなる? |
可変長系列 |
0 |
0% |
- |
- |
| pack_sequenceは概念的にどの2処理をまとめたAPI? |
可変長系列 |
0 |
0% |
- |
- |
| pad_packed_sequenceのtotal_lengthは何に使う? |
可変長系列 |
0 |
0% |
- |
- |
| pad_packed_sequenceは何を返す? |
可変長系列 |
0 |
0% |
- |
- |
| 可変長系列をpaddingする主な理由は? |
可変長系列 |
0 |
0% |
- |
- |
| 右paddingした可変長系列でout[:,-1,:]を系列表現にする問題は? |
可変長系列 |
0 |
0% |
- |
- |
| 右paddingした系列へ時間方向max poolingを行うとき、padding位置を0にするだけでは危険なのはなぜ? |
可変長系列 |
0 |
0% |
- |
- |
| 右paddingの出力out(N,T,H)から各系列の最終有効状態をgatherする時刻indexは? |
可変長系列 |
0 |
0% |
- |
- |
| 明示的なmaskでpadding位置をtoken損失から除外する場合、reductionはまず何にする? |
可変長系列 |
0 |
0% |
- |
- |
| 有効token mask m_(n,t)を使うRNN出力h_(n,t)のmasked mean pooling式は? |
可変長系列 |
0 |
0% |
- |
- |
| 長さ順に手動ソートしたバッチを元の順序へ戻す逆置換はどう作る? |
可変長系列 |
0 |
0% |
- |
- |
| PyTorchのRNN/LSTM/GRUでdropout引数はどこに適用される? |
多層RNN |
0 |
0% |
- |
- |
| PyTorchのnum_layersと系列長Tは同じ意味? |
多層RNN |
0 |
0% |
- |
- |
| keras.layers.RNNへcellのリストを渡すとどうなる? |
多層RNN |
0 |
0% |
- |
- |
| num_layers=1のPyTorch RNNへdropout>0を指定すると、組込みdropoutは有効? |
多層RNN |
0 |
0% |
- |
- |
| 双方向多層RNNで上位層の1時刻入力次元は、通常hidden_size Hの何倍? |
多層RNN |
0 |
0% |
- |
- |
| 多層RNNで第2層が受け取るものは? |
多層RNN |
0 |
0% |
- |
- |
| 多層RNN(stacked RNN)とは? |
多層RNN |
0 |
0% |
- |
- |
| 多層化すればRNNの性能は必ず向上する? |
多層RNN |
0 |
0% |
- |
- |
| beam widthを1にしたbeam searchは何に相当する? |
探索・デコーディング |
0 |
0% |
- |
- |
| greedy decodingとbeam searchの違いは? |
探索・デコーディング |
0 |
0% |
- |
- |
| 対数確率の単純和でbeam候補を比較すると短い系列へ偏りやすいのはなぜ? |
探索・デコーディング |
0 |
0% |
- |
- |
| Many-to-One型RNNの入出力例は? |
系列入出力 |
0 |
0% |
- |
- |
| One-to-Many型RNNの入出力例は? |
系列入出力 |
0 |
0% |
- |
- |
| RNNは各時刻で出力する構成と、系列を読み終えてから出力する構成の両方を作れる? |
系列入出力 |
0 |
0% |
- |
- |
| RNNを用いた機械翻訳は、どのような系列変換として捉えられる? |
系列入出力 |
0 |
0% |
- |
- |
| 入力と出力の時刻が対応するMany-to-Many型RNNの例は? |
系列入出力 |
0 |
0% |
- |
- |
| 入力後に出力系列を生成するMany-to-Many型の代表構造は? |
系列入出力 |
0 |
0% |
- |
- |
| 画像キャプション生成でCNNとRNNを組み合わせる典型的な役割分担は? |
系列入出力 |
0 |
0% |
- |
- |
| softmax temperature τを1未満にすると生成分布はどうなる? |
系列生成 |
0 |
0% |
- |
- |
| top-k samplingとtop-p samplingの候補集合の違いは? |
系列生成 |
0 |
0% |
- |
- |
| 次トークン予測でtokens=[BOS,A,B,EOS]から作る入力と教師の代表例は? |
系列生成 |
0 |
0% |
- |
- |
| 自己回帰decoderが系列yの条件付き確率を分解する式は? |
系列生成 |
0 |
0% |
- |
- |
| token単位の平均負の対数尤度をLとすると、perplexityは? |
言語モデル |
0 |
0% |
- |
- |
| RNNで時間ステップ間に共有されるものは? |
重み共有 |
0 |
0% |
- |
- |
| RNNの状態遷移をtime-invariantと呼べるのはなぜ? |
重み共有 |
0 |
0% |
- |
- |
| TimeRNNで時刻ごとに別なのはレイヤと学習パラメータ(params)のどちら? |
重み共有 |
0 |
0% |
- |
- |
| 同じRNNセルをT時刻へ展開すると、学習パラメータ数はT倍になる? |
重み共有 |
0 |
0% |
- |
- |
| 時間展開図に同じ記号Wが各時刻に描かれる意味は? |
重み共有 |
0 |
0% |
- |
- |
| RNNで勾配爆発が疑われる代表的な兆候は? |
長期依存性 |
0 |
0% |
- |
- |
| RNNにおける長期依存性とは? |
長期依存性 |
0 |
0% |
- |
- |
| RNNの勾配消失とは? |
長期依存性 |
0 |
0% |
- |
- |
| RNNの勾配爆発とは? |
長期依存性 |
0 |
0% |
- |
- |
| RNNの活性化をReLUにすれば勾配消失を必ず防げる? |
長期依存性 |
0 |
0% |
- |
- |
| sigmoidやtanhを使うRNNで勾配消失が起こりやすいのはなぜ? |
長期依存性 |
0 |
0% |
- |
- |
| 一定の忘却係数0<f<1に対する記憶の半減時刻kの近似式は? |
長期依存性 |
0 |
0% |
- |
- |
| 再帰重みW_hhのスペクトル半径だけでRNNの勾配消失・爆発を完全に判定できる? |
長期依存性 |
0 |
0% |
- |
- |
| 忘却ゲートが各時刻一定f=0.9で新規書込みを無視すると、10時刻後に残る割合は? |
長期依存性 |
0 |
0% |
- |
- |
| 時刻kからtへの単純RNNの勾配に現れる本質的な形は? |
長期依存性 |
0 |
0% |
- |
- |
| 時間方向Jacobianのノルムが継続的に1未満または1超なら、勾配はどうなりやすい? |
長期依存性 |
0 |
0% |
- |
- |
| 線形RNNで再帰行列の固有値の絶対値がすべて1未満なら、h_0の影響は一般にどうなる? |
長期依存性 |
0 |
0% |
- |
- |
| 線形RNNで初期状態h_0が時刻tの状態へ与える直接的な係数は? |
長期依存性 |
0 |
0% |
- |
- |