中文

关注小权重

机器学习 2025-10-23 v2 人工智能

摘要

微调大型预训练神经网络在内存和计算成本方面都是资源密集型的。为了缓解这一问题,一种常见的方法是将训练限制在模型参数的一个子集上。通过分析微调过程中梯度与权重之间的关系,我们观察到一个显著的模式:大梯度通常与小幅度权重相关联。这种相关性在微调设置中比从头训练更为明显。受此观察启发,我们提出了NANOADAM,它在微调过程中仅动态更新小幅度权重,并具有几个实际优势:首先,该准则无需梯度——参数子集可以在不计算梯度的情况下确定;其次,它保留了大幅度权重,这些权重很可能编码了预训练期间学到的关键特征,从而降低了灾难性遗忘的风险;第三,它允许使用更大的学习率,并在实验中持续带来更好的泛化性能。我们在自然语言处理和视觉任务上都证明了这一点。

关键词

引用

@article{arxiv.2506.21374,
  title  = {Pay Attention to Small Weights},
  author = {Chao Zhou and Tom Jacobs and Advait Gadhikar and Rebekka Burkholz},
  journal= {arXiv preprint arXiv:2506.21374},
  year   = {2025}
}