ダッシュボード
学習開始
カード管理
カード編集
問題
答え・判断基準
AdaGradは勾配二乗を学習開始からずっと累積するため学習率が急速に減衰し停滞しやすい。RMSPropは指数関数的に減衰する移動平均(γG_(t-1)+(1-γ)g_t²)を使うことで過去の勾配情報を徐々に忘れ、より高速に収束する。
種類
即答
選択肢消去
数式
PyTorch対応
用語
章
論点
解説
AdaGradはG_tが単調に増加し続ける(過去の勾配二乗を減衰させずに足し続ける)ため、学習が進むほど学習率η/√(G_t+ε)が際限なく小さくなり、途中で学習がほぼ止まってしまう問題がある。RMSPropはG_t=γG_(t-1)+(1-γ)g_t²のように指数移動平均を使うことで「直近の勾配情報」を重視し、古い勾配情報を徐々に忘れる(重みを下げる)ため、学習率が下がりすぎずAdaGradより高速に収束しやすい。
Is active
保存
キャンセル