在神经网络中围绕宽平坦极小 shaped 学习景观
机器学习
2020-03-12 v4 无序系统与神经网络
机器学习
摘要
深度神经网络(DNN)中的学习通过最小化非凸高维损失函数实现,通常采用随机梯度下降(SGD)策略。观察到学习过程能够找到良好的极小点而不陷入局部临界点,并且此类极小点通常能较好地避免过拟合。在由数百万可调节连接组成的非线性设备中,如何控制这两个特性是一个深刻且影响深远的开放问题。在本文中,我们研究了学习随机模式的基础非凸单层与两层神经网络模型,并推导了若干暗示部分答案的基础几何与算法特性。我们首先证明误差损失函数存在少数极宽平坦极小点(WFM),它们与较窄的极小点及临界点共存。我们随后证明交叉熵损失函数的极小点与误差损失的 WFM 重叠。我们还展示了不存在 WFM 的学习设备示例。从算法角度,我们推导了熵驱动的贪心与消息传递算法,将其搜索聚焦于极小点的宽平坦区域。在 SGD 与交叉熵损失的情形下,我们证明沿学习过程缓慢减小权重范数同样会导致 WFM。我们通过在实际数据上关于极小点体积、其 Hessian 及其泛化性能之间相关性的数值研究证实了上述结果。
引用
@article{arxiv.1905.07833,
title = {Shaping the learning landscape in neural networks around wide flat minima},
author = {Carlo Baldassi and Fabrizio Pittorino and Riccardo Zecchina},
journal= {arXiv preprint arXiv:1905.07833},
year = {2020}
}
备注
37 pages (16 main text), 10 figures (7 main text)