FOCUS:一阶集中更新方案
机器学习
2025-01-22 v1 计算与语言
最优化与控制
摘要
大型语言模型(LLM)表现出惊人的性能,提高其预训练过程的能力可能是进一步提升其能力的关键。基于 Adam、学习率衰减和权重衰减的已证明成功,我们假设预训练损失景观具有收窄谷底结构。通过对合成损失函数进行实验,我们发现当梯度查询噪声相对于谷底锋利度较高时,Adam 的性能落后于 Signum,因为 Adam 会过度削减有效步长。此观察促使我们开发了 FOCUS,一种通过纳入吸引力向移动平均参数的 Signum,以更好地处理噪声同时保持较大步幅的优化器。在训练 GPT-2 时,FOCUS 比 Signum 更稳定,速度更快于 Adam。这些结果表明,梯度噪声可能是 LLM 训练中被低估的限制因素,FOCUS 提供了有前景的解决方案。
引用
@article{arxiv.2501.12243,
title = {FOCUS: First Order Concentrated Updating Scheme},
author = {Yizhou Liu and Ziming Liu and Jeff Gore},
journal= {arXiv preprint arXiv:2501.12243},
year = {2025}
}
备注
19 pages, 8 figures