中文

彩票票假设为何奏效?剪枝神经网络样本复杂度的理论视角

机器学习 2021-12-06 v1 最优化与控制

摘要

彩票票假设(lottery ticket hypothesis, LTH)指出,在适当剪枝的网络(即“中奖票”)上学习比在原始未剪枝网络上具有更高的测试准确率。尽管 LTH 已在计算机视觉和自然语言处理等大量深度神经网络(DNN)相关应用中得到经验验证,但中奖票泛化能力提升的理论验证仍不明朗。据我们所知,我们的工作首次通过分析目标函数的几何结构以及实现零泛化误差所需的样本复杂度,刻画了训练剪枝神经网络的表现。我们表明,随着神经网络模型被剪枝,具有保证泛化的理想模型附近的凸区域会扩大,这表明了中奖票的结构重要性。此外,当训练剪枝神经网络的算法被指定为(加速)随机梯度下降算法时,我们从理论上证明,实现零泛化误差所需的样本数量与隐藏层中未剪枝权重的数量成正比。在固定样本数下,训练剪枝神经网络比训练原始未剪枝网络更快收敛到期望模型,从而为中奖票泛化能力提升提供了形式化依据。我们的理论结果来自对单隐藏层剪枝神经网络的学习,同时我们还提供了实验结果表明其在多层神经网络剪枝中的含义。

关键词

引用

@article{arxiv.2110.05667,
  title  = {Why Lottery Ticket Wins? A Theoretical Perspective of Sample Complexity on Pruned Neural Networks},
  author = {Shuai Zhang and Meng Wang and Sijia Liu and Pin-Yu Chen and Jinjun Xiong},
  journal= {arXiv preprint arXiv:2110.05667},
  year   = {2021}
}