中文

ReLU神经网络的正尺度不变平坦性

机器学习 2019-03-07 v1 机器学习

摘要

Keskar等人[SharpMinima]通过实验证实较平坦的最小值具有更好的泛化能力。然而,对于流行的ReLU网络,尖锐最小值也能泛化良好[SharpMinimacan]。该结论表明,现有平坦性定义未能涵盖ReLU神经网络的复杂几何结构,因为它们无法覆盖ReLU网络的正尺度不变(PSI)性质。本文中,我们形式化了PSI导致现有平坦性定义的问题,并提出了一种平坦性的新描述——\emph{PSI-平坦性}。PSI-平坦性定义于基路径[GSGD]的取值而非权重之上。基路径的取值已被证明是PSI变量,且能充分表示ReLU神经网络,从而确保PSI-平坦性的PSI性质。随后我们从理论和实验上研究了PSI-平坦性与泛化能力的关系。首先,我们基于PSI-平坦性给出了一个泛化界,表明泛化误差随最大基路径取值与最小基路径取值之比的减小而降低。也就是说,具有均衡基路径取值的最小值更可能是平坦的且泛化更好。最后,我们可视化了两个已学习模型周围损失面的PSI-平坦性,表明具有更小PSI-平坦性的最小值确实能泛化更好。

关键词

引用

@article{arxiv.1903.02237,
  title  = {Positively Scale-Invariant Flatness of ReLU Neural Networks},
  author = {Mingyang Yi and Qi Meng and Wei Chen and Zhi-ming Ma and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:1903.02237},
  year   = {2019}
}