【深度学习】关于Adam

时间：2019-08-20 01:12:10 阅读：145 评论：0 收藏：0 [点我收藏+]

本文链接：https://blog.csdn.net/weixin_31866177/article/details/88601294

从SGD（SGD指mini-batch gradient descent）和Adam两个方面说起。

更详细的可以看：深度学习最全优化方法总结比较（SGD，Adagrad，Adadelta，Adam，Adamax，Nadam）（醍醐灌顶！）

SGD

SGD就是每一次迭代计算mini-batch的梯度，然后对参数进行更新，是最常见的优化方法了。即：

技术分享图片

其中， $技术分享图片$ 是学习率， $技术分享图片$ 是梯度 SGD完全依赖于当前batch的梯度，所以 $技术分享图片$ 可理解为允许当前batch的梯度多大程度影响参数更新。

缺点：（正因为有这些缺点才让这么多大神发展出了后续的各种算法）

选择合适的learning rate比较困难 - 对所有的参数更新使用同样的learning rate。对于稀疏数据或者特征，有时我们可能想更新快一些对于不经常出现的特征，对于常出现的特征更新慢一些，这时候SGD就不太能满足要求了

SGD容易收敛到局部最优，并且在某些情况下可能被困在鞍点【原来写的是“容易困于鞍点”，经查阅论文发现，其实在合适的初始化和step size的情况下，鞍点的影响并没这么大。感谢@冰橙的指正】

参数取值震荡严重。（我自己添加的）