| 問題 | 論点 | 回答回数 | 正答率 | 最短秒 | 平均秒 |
| 120個のユニットにnn.Dropout(p=0.25)を適用したとき、訓練時に無効化・保持されるユニット数の期待値は? |
ドロップアウト |
0 |
0% |
- |
- |
| Dropoutを含むPyTorchモデルを推論するとき、net.eval()とtorch.no_grad()はそれぞれ何のために使う? |
ドロップアウト |
0 |
0% |
- |
- |
| inverted dropoutでx=(4, 8, -2)、p=0.5、保持マスクが(1, 0, 1)のとき、訓練時の出力は? |
ドロップアウト |
0 |
0% |
- |
- |
| inverted dropoutで入力値が6、ドロップ率p=0.25のとき、訓練時に保持された場合の出力と、全体の出力の期待値は? |
ドロップアウト |
0 |
0% |
- |
- |
| nn.Dropout(p=0.2)の意味は? |
ドロップアウト |
0 |
0% |
- |
- |
| ドロップアウトとドロップコネクトの違いは? |
ドロップアウト |
0 |
0% |
- |
- |
| ドロップアウトとバギングでは、推論時の予測のまとめ方がどう違う? |
ドロップアウト |
0 |
0% |
- |
- |
| ドロップアウトの式(出力yを求める式)は? |
ドロップアウト |
0 |
0% |
- |
- |
| ドロップアウトの推論時の挙動は? |
ドロップアウト |
0 |
0% |
- |
- |
| ドロップアウトの訓練時の挙動は? |
ドロップアウト |
0 |
0% |
- |
- |
| ドロップアウト/ドロップコネクトのマスクrの各要素は何に従い、0と1は何を表す? |
ドロップアウト |
0 |
0% |
- |
- |
| 一定の確率でネットワークの隠れ層のノードを無効化することで過剰適合を抑制する手法を何という? |
ドロップアウト |
0 |
0% |
- |
- |
| 古典的なDropoutとinverted dropoutでは、期待値を揃えるスケーリングをいつ行う? |
ドロップアウト |
0 |
0% |
- |
- |
| 数式中の保持確率pと、PyTorchのnn.Dropout(p=0.2)のpは同じ意味? |
ドロップアウト |
0 |
0% |
- |
- |
| 独立な0/1マスクを適用するユニットが8個あるとき、生成可能なマスクパターンは何通り? |
ドロップアウト |
0 |
0% |
- |
- |
| DropConnectでdrop_rate=0.2のとき、有効なノードの値は何倍される? |
ドロップコネクト |
0 |
0% |
- |
- |
| DropConnectの推論時の挙動は? |
ドロップコネクト |
0 |
0% |
- |
- |
| ドロップコネクトの式(出力yを求める式)は? |
ドロップコネクト |
0 |
0% |
- |
- |
| 一定の割合で重み行列の要素をランダムにゼロにすることで過剰適合を抑制する手法を何という? |
ドロップコネクト |
0 |
0% |
- |
- |
| ある方向から見ると極小値、別の方向から見ると極大値となる点を何という? |
ハイパーパラメータ |
0 |
0% |
- |
- |
| バッチサイズが学習に与える影響として正しいのは? |
ハイパーパラメータ |
0 |
0% |
- |
- |
| 学習率が大きすぎると、学習はどうなる可能性がある? |
ハイパーパラメータ |
0 |
0% |
- |
- |
| 学習率が小さすぎるとどうなる? |
ハイパーパラメータ |
0 |
0% |
- |
- |
| 小さいバッチサイズは少ないエポックで精度が上がりやすいのに、「常に学習が速い」とは言えないのはなぜ? |
ハイパーパラメータ |
0 |
0% |
- |
- |
| Early Stoppingのpatienceは何を表す? |
早期終了 |
0 |
0% |
- |
- |
| 早期終了(Early Stopping)を行うべきタイミングは? |
早期終了 |
0 |
0% |
- |
- |
| 検証誤差が増加し始めたタイミングで学習を打ち切り、過剰適合を防ぐ手法を何という? |
早期終了 |
0 |
0% |
- |
- |
| L1正則化とL2正則化、それぞれ損失関数に加える正則化項の式は? |
正則化 |
0 |
0% |
- |
- |
| L1正則化とL2正則化、特徴量選択に適しているのはどちら? |
正則化 |
0 |
0% |
- |
- |
| L1正則化とL2正則化を組み合わせた手法を何という? |
正則化 |
0 |
0% |
- |
- |
| L1正則化の実装(PyTorch)として正しいのは? |
正則化 |
0 |
0% |
- |
- |
| L1正則化・L2正則化はバイアス項にも制約を課す? |
正則化 |
0 |
0% |
- |
- |
| L1正則化項とL2正則化項の等高線は、それぞれどのような形になる? |
正則化 |
0 |
0% |
- |
- |
| L2正則化が一般的な機械学習・回帰問題でそれぞれ呼ばれる名称は? |
正則化 |
0 |
0% |
- |
- |
| L2正則化と平均二乗誤差(MSE)は、どちらも二乗を使うが何が違う? |
正則化 |
0 |
0% |
- |
- |
| L2正則化の実装(PyTorch)として正しいのは? |
正則化 |
0 |
0% |
- |
- |
| PyTorchで手動の正則化項を含めて学習する場合、1ミニバッチの基本的な処理順序は? |
正則化 |
0 |
0% |
- |
- |
| SGDとAdamでL2正則化(Weight Decay)の効果に違いが出るのはなぜ? |
正則化 |
0 |
0% |
- |
- |
| torch.abs(torch.sum(param))がL1正則化項にならないのはなぜ? |
正則化 |
0 |
0% |
- |
- |
| torch.square(torch.sum(param))がL2正則化項にならないのはなぜ? |
正則化 |
0 |
0% |
- |
- |
| w=(1, -1, 2)、データ損失0.80、λ1=0.10、λ2=0.05のElastic Net損失L=L_data+λ1Σ|wi|+λ2Σwi²は? |
正則化 |
0 |
0% |
- |
- |
| データ損失が0.60、w=(1, -2, 2)、L2正則化係数λ=0.05のとき、総損失L=L_data+λΣwi²は? |
正則化 |
0 |
0% |
- |
- |
| データ損失が0.80、w=(-2, 1, 0.5)、L1正則化係数λ=0.10のとき、総損失L=L_data+λΣ|wi|は? |
正則化 |
0 |
0% |
- |
- |
| バッチ正規化とドロップアウトの適用順序で推奨されるのは? |
正則化 |
0 |
0% |
- |
- |
| パラメータに制約を課すことで過学習を防ぐ、L1/L2正則化のような正則化を何という? |
正則化 |
0 |
0% |
- |
- |
| リッジ回帰・ラッソ回帰と呼ばれるのはそれぞれL1/L2のどちら? |
正則化 |
0 |
0% |
- |
- |
| 学習プロセスやモデルの構造が持つ性質を利用して過学習を防ぐ、ドロップアウトや早期終了のような正則化を何という? |
正則化 |
0 |
0% |
- |
- |
| 正則化を加えた損失関数の基本形と、正則化係数λの役割は? |
正則化 |
0 |
0% |
- |
- |
| 正則化項をΩ1(w)=Σ|wi|、Ω2(w)=Σwi²とする。w=(-2, 0.5, 1.5)のL1正則化項とL2正則化項は? |
正則化 |
0 |
0% |
- |
- |
| 訓練誤差ではなく汎化誤差の減少を目的とした学習アルゴリズムの改良全般を何という? |
正則化 |
0 |
0% |
- |
- |