熵梯度下降算法与宽平坦极小值
机器学习
2022-01-12 v4 无序系统与神经网络
机器学习
摘要
关于神经网络经验风险景观中平坦极小值的性质,已经争论了一段时间。越来越多的证据表明,与尖锐极小值相比,它们具有更好的泛化能力。首先,我们讨论了高斯混合分类模型,并分析性地证明了存在贝叶斯最优点估计器,这些估计器对应于属于宽平坦区域的极小值点。这些估计器可以通过直接对分类器(与范数无关)或对学习中使用的可微损失函数应用最大平坦度算法来找到。接下来,我们通过广泛的数值验证将分析扩展到深度学习场景。使用两种算法,即 Entropy-SGD 和 Replicated-SGD,它们在优化目标中显式地包含了一种称为局部熵的非局部平坦度度量,我们持续改善了常见架构(例如 ResNet、EfficientNet)的泛化误差。一个易于计算的平坦度度量显示出与测试准确率有明显的相关性。
引用
@article{arxiv.2006.07897,
title = {Entropic gradient descent algorithms and wide flat minima},
author = {Fabrizio Pittorino and Carlo Lucibello and Christoph Feinauer and Gabriele Perugini and Carlo Baldassi and Elizaveta Demyanenko and Riccardo Zecchina},
journal= {arXiv preprint arXiv:2006.07897},
year = {2022}
}
备注
ICLR 2021 camera-ready