提要
一般的梯度下降公式为
w=w-dw
b=b-db
这里提到的是对于一般的梯度下降的优化方案
1 动量梯度下降 (Gradient Descent with Momentum)
v_{dw}=\beta v_{dw}+(1-\beta)dW
v_{db}=\beta v_{db}+(1-\beta)db
\beta是指数加权平均数的系数,一般取值为0.9
接下来是对参数的更新:
W = W - \alpha v_{dw}
b = b - \alpha v_{db}
2 RMSprop (Root Mean Square Rrop)
s_{dw}=\beta v_{dw}+(1-\beta)(dW)^2
s_{db}=\beta v_{db}+(1-\beta)(db)^2
接下来是对参数的更新:
W = W - \alpha \frac{dW}{\sqrt{s_{dw}}}
b = b - \alpha \frac{db}{\sqrt{s_{db}}}
3 Adam优化算法 (Adam Optimization Algorithm)
注意:在使用Momentum、RMSprop 可以不使用偏差修正,但是Adam需要。v^{corrected}_{dw}=\frac{v_{dw}}{1-\beta^t_1}
v^{corrected}_{db}=\frac{v_{db}}{1-\beta^t_1}
s^{corrected}_{dw}=\frac{s_{dw}}{1-\beta^t_2}
s^{corrected}_{db}=\frac{s_{db}}{1-\beta^t_2}
W=W-\alpha \frac{v^{corrected}_{dw}}{\sqrt{s^{corrected}_{dw}} + \epsilon}
b=b-\alpha \frac{v^{corrected}_{db}}{\sqrt{s^{corrected}_{db}} + \epsilon}