中文

镜像下降最大化广义间隔且可高效实现

机器学习 2023-06-27 v2

摘要

受深度神经网络经验成功与广泛使用的推动,理解过参数化模型的泛化性能已成为日益流行的问题。为此,已有大量工作刻画所用优化算法(如梯度下降(GD))的隐式偏置及其偏好解的结构性质。本文回答了该文献中的一个开放问题:在分类设定下,镜像下降(MD)收敛到什么解?具体地,受其高效实现驱动,我们考虑势函数选为 p\ell_p-范数 pp 次幂的镜像下降算法族,这是 GD 的重要推广。我们称此算法为 pp-GD\textsf{GD}。对于该族,我们刻画其获得的解,并证明在线性可分分类下它沿方向收敛到关于 p\ell_p-范数的广义最大间隔解。尽管 MD 更新规则一般计算代价高昂,或许不适合深度学习,但 pp-GD\textsf{GD} 可像 SGD 一样完全并行化,并可用于训练深度神经网络而几乎无额外计算开销。通过使用线性和深度神经网络模型的综合实验,我们证明 pp-GD\textsf{GD} 能显著影响所学模型的结构与泛化性能。

关键词

引用

@article{arxiv.2205.12808,
  title  = {Mirror Descent Maximizes Generalized Margin and Can Be Implemented Efficiently},
  author = {Haoyuan Sun and Kwangjun Ahn and Christos Thrampoulidis and Navid Azizan},
  journal= {arXiv preprint arXiv:2205.12808},
  year   = {2023}
}