梯度消失（vanishing gradient）与梯度爆炸（exploding gradient）问题

时间：2017-10-20 15:26:33 阅读：333 评论：0 收藏：0 [点我收藏+]

（1）梯度不稳定问题：

什么是梯度不稳定问题：深度神经网络中的梯度不稳定性，前面层中的梯度或会消失，或会爆炸。

原因：前面层上的梯度是来自于后面层上梯度的乘乘积。当存在过多的层次时，就出现了内在本质上的不稳定场景，如梯度消失和梯度爆炸。

（2）梯度消失（vanishing gradient problem）：

原因：例如三个隐层、单神经元网络：

则可以得到：

然而，sigmoid方程的导数曲线为：

可以看到，sigmoid导数的最大值为1/4，通常abs（w）<1,则：

前面的层比后面的层梯度变化更小，故变化更慢，从而引起了梯度消失问题。

（3）梯度爆炸（exploding gradient problem）：

当权值过大，前面层比后面层梯度变化更快，会引起梯度爆炸问题。

（4）sigmoid时，消失和爆炸哪个更易发生？

量化分析梯度爆炸出现时a的树枝范围：因为sigmoid导数最大为1/4，故只有当abs(w)>4时才可能出现

由此计算出a的数值变化范围很小，仅仅在此窄范围内会出现梯度爆炸问题。而最普遍发生的是梯度消失问题。

（5）如何解决梯度消失和梯度爆炸？

使用ReLU,maxout等替代sigmoid。（具体细节请看博主之前神经网络激活函数部分）

区别：（1）sigmoid函数值在[0,1],ReLU函数值在[0,+无穷]，所以sigmoid函数可以描述概率，ReLU适合用来描述实数；（2）sigmoid函数的梯度随着x的增大或减小和消失，而ReLU不会。

梯度消失（vanishing gradient）与梯度爆炸（exploding gradient）问题

原文：http://www.cnblogs.com/DjangoBlog/p/7699664.html

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年09月23日 (328)
2021年09月24日 (313)
2021年09月17日 (191)
2021年09月15日 (369)
2021年09月16日 (411)
2021年09月13日 (439)
2021年09月11日 (398)
2021年09月12日 (393)
2021年09月10日 (160)
2021年09月08日 (222)