中文

重新思考权重衰减以实现基础模型的鲁棒微调

机器学习 2024-11-05 v1 计算与语言 计算机视觉与模式识别

摘要

现代优化器如 AdamW,配备动量和自适应学习率,旨在逃离局部最小值并探索广阔的参数空间。这种探索在从头训练时有助于找到良好的损失盆地。但在从强大的基础模型恢复训练时,这并不理想,因为它可能导致偏离预训练初始化较远,进而导致更差的鲁棒性和泛化能力。同时,对所有参数施加强正则化可能导致欠拟合。我们假设选择性正则化参数空间是拟合和重新训练预训练知识的关键。本论文提出了一种新的权重衰减技术——选择性投影衰减(SPD),它对某些层施加强惩罚,同时允许其他层自由变化。从直觉上讲,SPD 分别扩展和收缩具有一致和不一致损失减少的层的参数搜索空间。实验表明,配备 SPD 的 Adam 在多个流行的视觉和语言基准测试中始终提供更好的分布内泛化和分布外鲁棒性性能。代码可在 https://github.com/GT-RIPL/Selective-Projection-Decay.git 获取。

关键词

引用

@article{arxiv.2411.01713,
  title  = {Rethinking Weight Decay for Robust Fine-Tuning of Foundation Models},
  author = {Junjiao Tian and Chengyue Huang and Zsolt Kira},
  journal= {arXiv preprint arXiv:2411.01713},
  year   = {2024}
}

备注

Accepted to Neurips 2024