从PAC-贝叶斯理论视角分析彩票假设
机器学习
2022-09-29 v3 机器学习
摘要
彩票假设(LTH)因其能够解释为何过参数化模型常表现出高泛化能力而受到关注。已知当我们使用迭代幅值剪枝(IMP)——一种用于寻找可从初始权重独立训练且具高泛化能力的稀疏网络(称为中奖彩票)的算法——时,较大的初始学习率在ResNet等深度神经网络中效果不佳。然而,由于较大的初始学习率通常有助于优化器收敛到更平坦的最小值,我们假设中奖彩票具有相对尖锐的最小值,这被视为泛化能力方面的劣势。本文中,我们证实了该假设,并表明PAC-贝叶斯理论能够明确理解LTH与泛化行为之间的关系。基于我们的实验发现——平坦性有助于提升准确率和对标签噪声的鲁棒性,且距初始权重的距离深度参与中奖彩票——我们给出使用尖峰- slab分布的PAC-Bayes界来分析中奖彩票。最后,我们从PAC-贝叶斯视角重新审视现有的寻找中奖彩票的算法,并为这些方法提供新的见解。
引用
@article{arxiv.2205.07320,
title = {Analyzing Lottery Ticket Hypothesis from PAC-Bayesian Theory Perspective},
author = {Keitaro Sakamoto and Issei Sato},
journal= {arXiv preprint arXiv:2205.07320},
year = {2022}
}
备注
NeurIPS 2022