给每个优化器一个范数,给每个范数其泛化性
机器学习
2022-07-12 v1 机器学习
摘要
我们研究了在欠参数化和过参数化情形下,对插值训练数据的线性模型优化方法的隐式正则化。由于难以确定优化器是否收敛到最小化已知范数的解,我们翻转问题并研究插值解所对应的最小化范数。利用这一推理,我们证明对于过参数化线性回归,向线性张成的投影可用于在不同插值解之间移动。对于欠参数化线性分类,我们证明对于任意分离数据的线性分类器,存在一族二次范数 ||.||_P 使得该分类器的方向与最大 P-间隔解的方向相同。对于线性分类,我们认为分析收敛到标准最大 l2-间隔是任意的,并展示最小化由数据诱导的范数可带来更好的泛化。此外,对于过参数化线性分类,向数据张成的投影使我们能使用欠参数化情形中的技术。在实验方面,我们提出将优化器偏向更好泛化解的技术,改善其测试性能。我们通过合成实验验证理论结果,并使用神经正切核处理非线性模型。
引用
@article{arxiv.2006.06821,
title = {To Each Optimizer a Norm, To Each Norm its Generalization},
author = {Sharan Vaswani and Reza Babanezhad and Jose Gallego-Posada and Aaron Mishkin and Simon Lacoste-Julien and Nicolas Le Roux},
journal= {arXiv preprint arXiv:2006.06821},
year = {2022}
}