神经网络训练中的 Dropout:解的平坦性与噪声结构
机器学习
2022-05-24 v2
摘要
理解流行的正则化方法 dropout 如何帮助神经网络训练找到良好泛化解十分重要。本工作中,我们表明相较标准梯度下降训练,带 dropout 的训练能找到具有更平坦极小值的神经网络。我们进一步通过 MNIST、CIFAR-10、CIFAR-100 与 Multi30k 等多种数据集,以及全连接网络、大型残差卷积网络与 transformer 等多种结构上的实验发现:dropout 诱导噪声的方差在损失地貌的更尖锐方向上更大,且所找到极小点处损失地貌的 Hessian 与噪声协方差矩阵对齐。对于具有分段线性激活函数且 dropout 仅置于最后隐藏层的网络,我们进而在理论上推导了 Hessian 与 dropout 随机性的协方差,二者非常相似。这一相似性或许是 dropout 有效性的关键原因。
引用
@article{arxiv.2111.01022,
title = {Dropout in Training Neural Networks: Flatness of Solution and Noise Structure},
author = {Zhongwang Zhang and Hanxu Zhou and Zhi-Qin John Xu},
journal= {arXiv preprint arXiv:2111.01022},
year = {2022}
}