中文

过参数化线性回归中自适应方法的泛化性研究

机器学习 2020-12-01 v1 机器学习

摘要

在过去的十年中,过参数化和自适应方法在深度学习的成功中发挥了关键作用。过参数化的广泛使用迫使我们通过提出新的现象来重新思考泛化问题,例如优化算法的隐式正则化和随训练进程出现的双下降现象。一系列近期工作已开始在这些领域揭示谜底,以探求——为什么神经网络泛化良好?过参数化线性回归的设定为理解神经网络的这种神秘行为提供了关键见解。在本文中,我们旨在刻画过参数化线性回归设定下自适应方法的性能。首先,我们根据泛化性能将自适应方法聚焦于两个子类。对于第一类自适应方法,参数向量保持在数据的张成空间中,并像梯度下降(GD)一样收敛到最小范数解。另一方面,对于第二类自适应方法,由预条件矩阵引起的梯度旋转导致参数向量的张成内分量收敛到最小范数解,而张成外分量则饱和。我们在过参数化线性回归和深度神经网络上的实验支持了这一理论。

关键词

引用

@article{arxiv.2011.14066,
  title  = {On Generalization of Adaptive Methods for Over-parameterized Linear Regression},
  author = {Vatsal Shah and Soumya Basu and Anastasios Kyrillidis and Sujay Sanghavi},
  journal= {arXiv preprint arXiv:2011.14066},
  year   = {2020}
}

备注

arXiv admin note: substantial text overlap with arXiv:1811.07055