镜像下降最大化广义间隔且可高效实现
机器学习
2023-06-27 v2
摘要
受深度神经网络经验成功与广泛使用的推动,理解过参数化模型的泛化性能已成为日益流行的问题。为此,已有大量工作刻画所用优化算法(如梯度下降(GD))的隐式偏置及其偏好解的结构性质。本文回答了该文献中的一个开放问题:在分类设定下,镜像下降(MD)收敛到什么解?具体地,受其高效实现驱动,我们考虑势函数选为 -范数 次幂的镜像下降算法族,这是 GD 的重要推广。我们称此算法为 -。对于该族,我们刻画其获得的解,并证明在线性可分分类下它沿方向收敛到关于 -范数的广义最大间隔解。尽管 MD 更新规则一般计算代价高昂,或许不适合深度学习,但 - 可像 SGD 一样完全并行化,并可用于训练深度神经网络而几乎无额外计算开销。通过使用线性和深度神经网络模型的综合实验,我们证明 - 能显著影响所学模型的结构与泛化性能。
引用
@article{arxiv.2205.12808,
title = {Mirror Descent Maximizes Generalized Margin and Can Be Implemented Efficiently},
author = {Haoyuan Sun and Kwangjun Ahn and Christos Thrampoulidis and Navid Azizan},
journal= {arXiv preprint arXiv:2205.12808},
year = {2023}
}