成績:深層モデルのための最適化

← カテゴリー一覧へ戻る

問題論点回答回数正答率最短秒平均秒
AdaGradの更新式は? AdaGrad 0 0% - -
過去の勾配の二乗を単純に累積し、パラメータごとに学習率を自動調整する最適化アルゴリズムを何という? AdaGrad 4 25.0% 5.2 11.3
Adamでm0=v0=0、g1=2、β1=0.9、β2=0.999のとき、1ステップ目のm1・v1とバイアス補正後の値は? Adam 1 100.0% 15.0 15.0
Adamのm_tとv_tの更新式、およびそれぞれが表すものは? Adam 0 0% - -
Adamのバイアス補正はなぜ必要? Adam 0 0% - -
Adamは何と何を組み合わせたアルゴリズムか? Adam 2 100.0% 8.5 10.8
RMSPropにMomentumを組み合わせた最適化アルゴリズムを何という? Adam 3 66.7% 6.7 11.4
Momentumが解決する問題は? Momentum 1 100.0% 23.4 23.4
Momentumの「v=γv_prev+ηg、θ←θ-v」と「v=γv_prev-ηg、θ←θ+v」は同じ更新か? Momentum 0 0% - -
Momentumの更新式は? Momentum 1 100.0% 12.8 12.8
物理学の運動量に着想を得て、過去の勾配情報を利用して振動を抑制する最適化手法を何という? Momentum 4 75.0% 6.4 31.1
Momentum分だけ先読みした位置で勾配を計算し、収束を速める最適化手法を何という? NAG 5 80.0% 5.5 13.9
NAGでθ=5、v_prev=2、γ=0.9、η=0.1、先読み位置での勾配g=4のとき、先読み位置・新しいv・更新後θは? NAG 0 0% - -
NAG(Nesterov Accelerated Gradient)の更新式は? NAG 0 0% - -
Pathological Curvatureとは? Pathological Curvature 0 0% - -
目的関数の局所的な曲率が方向によって極端に異なり、学習が滞ってしまう現象を何という? Pathological Curvature 2 50.0% 44.8 54.4
AdaGradの欠点とRMSPropによる改善点は? RMSProp 1 100.0% 5.0 5.0
勾配の二乗の指数移動平均を使い、AdaGradの学習率急減衰問題を改善した最適化アルゴリズムを何という? RMSProp 5 40.0% 8.1 32.0
勾配二乗の状態G_prev=9、現在の勾配g=1、減衰率γ=0.9のとき、RMSPropの新しいGと、同じG_prevから始めるAdaGradの新しいGは? RMSProp 1 0.0% 16.8 16.8
He法(Kaiming法)はどの活性化関数に適している? パラメータ初期化 1 100.0% 10.9 10.9
ReLU向けに、Xavier法より広い分布で重みを初期化する手法を何という? パラメータ初期化 3 66.7% 4.8 6.8
Xavier法(Glorot法)はどの活性化関数に適している? パラメータ初期化 1 100.0% 14.7 14.7
n_in=64、n_out=32のとき、Xavier一様分布とHe一様分布の上下限は? パラメータ初期化 0 0% - -
シグモイドやtanh向けに、前後の層の出力の分散を揃えるように重みを初期化する手法を何という? パラメータ初期化 5 80.0% 7.2 105.2
勾配消失問題への対策として不適切なのは? 勾配消失 1 100.0% 16.5 16.5
モデルが外れ値やノイズに対して性能が崩れにくい性質を何という? 回帰 3 100.0% 5.8 11.2
SGDと最急降下法(バッチ勾配降下法)の違いは? 最適化手法 1 100.0% 19.7 19.7
SGDの更新式は? 最適化手法 1 0.0% 10.7 10.7
バッチ勾配降下法・狭義のSGD・ミニバッチ勾配降下法が、1回の更新に使うサンプル数の違いは? 最適化手法 0 0% - -
最急降下法(GD)の欠点は? 最適化手法 1 100.0% 14.8 14.8
確率的勾配降下法(SGD)における学習率の役割は? 最適化手法 1 100.0% 19.6 19.6
訓練データからランダムに一部(ミニバッチ)を取り出して勾配を計算し、パラメータを更新する最適化手法を何という? 最適化手法 4 50.0% 7.4 14.3
Sigmoid計算グラフで出力y=0.8、上流勾配∂L/∂y=3のとき、入力勾配∂L/∂xは? 計算グラフ 0 0% - -
h=σ(w1x+b1)、y=w2h+b2、L=(t-y)²とする。h=0.5、y=0.4、t=1、w2=0.8、x=(1,2,3)^Tのとき、∂L/∂w2と∂L/∂w1は? 計算グラフ 0 0% - -
w1が1×3行ベクトル、xが3×1列ベクトルのとき、∂L/∂w1の式の末尾はxとx^Tのどちら? 計算グラフ 1 100.0% 15.3 15.3
シグモイド関数を計算グラフで表したとき、「/」ノード(y=1/x)の逆伝播で乗算する値は? 計算グラフ 1 100.0% 318.7 318.7
全結合層の計算グラフでy=X・Wのとき、Wへの勾配は? 計算グラフ 1 0.0% 0.3 0.3
全結合層の計算グラフでy=X・Wのとき、Xへの勾配は? 計算グラフ 0 0% - -
計算の過程をノードとエッジで視覚的に表現し、微分を効率的に計算する手法を何という? 計算グラフ 3 100.0% 0.2 7.5
計算グラフの「exp」ノード(y=exp(x))の逆伝播で乗算する値は? 計算グラフ 1 100.0% 32.8 32.8
計算グラフのノードとエッジは何を表す? 計算グラフ 1 100.0% 13.0 13.0
f(x)=x²、g(u)=u³の合成関数g(f(x))を、連鎖律でx=2において微分すると? 誤差逆伝播法 0 0% - -
二乗誤差の微分で係数2が付く場合と付かない場合の違いは? 誤差逆伝播法 1 100.0% 84.6 84.6
合成関数の微分を、それを構成する各関数の微分の積として計算できるという性質を何という? 誤差逆伝播法 3 100.0% 4.2 6.7
誤差逆伝播法で利用する、合成関数の微分の性質は? 誤差逆伝播法 1 100.0% 6.8 6.8