最优学习率与批量大小扩展中的涌现现象
计算与语言
2024-11-01 v4 机器学习
摘要
在当前深度学习任务中,Adam 等变种优化器如 Adam、Adagrad、RMSProp、Adafactor 和 Lion 作为 SGD 变种优化器的替代方案被广泛使用。这些优化器通常使用梯度的符号来更新模型参数,从而实现更稳定的收敛曲线。学习率和批量大小是优化器最关键的超参数,需要精心调谐才能实现有效收敛。以往的研究表明,SGD 变种优化器的最优学习率随批量大小呈线性增加或遵循类似规则。然而,这一结论不适用于 Adam 变种优化器。本文通过理论分析和大量实验阐明了 Adam 变种优化器最优学习率与批量大小之间的关系。首先,我们提出了批量大小与最优学习率之间的 scaling law 在梯度符号的情况下,其中我们证明了随着批量大小增加,最优学习率首先上升然后下降。此外,涌现峰值会随着训练进程的推进逐渐移动到更大的批量大小。其次,我们在 various CV 和 NLP 任务上进行实验,并验证了 scaling law 的正确性。
引用
@article{arxiv.2405.14577,
title = {Representation Noising: A Defence Mechanism Against Harmful Finetuning},
author = {Domenic Rosati and Jan Wehner and Kai Williams and Łukasz Bartoszcze and David Atanasov and Robie Gonzales and Subhabrata Majumdar and Carsten Maple and Hassan Sajjad and Frank Rudzicz},
journal= {arXiv preprint arXiv:2405.14577},
year = {2024}
}
备注
Published in NeurIPs 2024