深度网络的能量景观
机器学习
2017-04-25 v5
摘要
我们引入了“AnnealSGD”,一种正则化随机梯度下降算法,其动机是对一类具有稀疏随机权重的深度网络的能量景观的分析。此类网络的损失函数可以用具有高斯耦合的球自旋玻璃的哈密顿量来近似。虽然与当前流行的架构(如卷积架构)不同,但自旋玻璃易于分析,这为损失函数的拓扑提供了见解,并启发了最小化它的算法。具体而言,我们展示了类似于磁场的正则化项可以通过单个标量参数进行调制,从而将损失函数从具有指数级多局部极小值的复杂非凸景观,过渡到具有多项式数量极小值的相,一直向下到具有唯一极小值的平凡景观。AnnealSGD在松弛的多项式阶段开始训练,并逐渐收紧正则化参数以将能量导向原始的指数阶段。即使对于与稀疏随机网络大不相同的卷积神经网络,我们也通过经验证明,在MNIST和CIFAR-10上使用具有竞争力的基线,AnnealSGD改善了泛化误差。
引用
@article{arxiv.1511.06485,
title = {On the energy landscape of deep networks},
author = {Pratik Chaudhari and Stefano Soatto},
journal= {arXiv preprint arXiv:1511.06485},
year = {2017}
}