ダッシュボード
学習開始
カード管理
カード編集
問題
答え・判断基準
全訓練データを使って勾配を計算するため、データが大きいとメモリ使用量が大きく計算コストが高い。局所最適解にも陥りやすい。
種類
即答
選択肢消去
数式
PyTorch対応
用語
章
論点
解説
最急降下法(Gradient Descent)は、1回のパラメータ更新のために訓練データ全体を使って勾配を計算する。データセットが大きいほど1更新あたりの計算量・メモリ使用量が膨大になり、また目的関数は単調に増減するわけではないため、勾配が小さい停滞領域(局所最適解やプラトー)に留まりやすいという欠点がある。SGDはランダムな部分データで勾配を近似することでこの欠点を克服する。
Is active
保存
キャンセル