中文

FOCUS:一阶集中更新方案

机器学习 2025-01-22 v1 计算与语言 最优化与控制

摘要

大型语言模型(LLM)表现出惊人的性能,提高其预训练过程的能力可能是进一步提升其能力的关键。基于 Adam、学习率衰减和权重衰减的已证明成功,我们假设预训练损失景观具有收窄谷底结构。通过对合成损失函数进行实验,我们发现当梯度查询噪声相对于谷底锋利度较高时,Adam 的性能落后于 Signum,因为 Adam 会过度削减有效步长。此观察促使我们开发了 FOCUS,一种通过纳入吸引力向移动平均参数的 Signum,以更好地处理噪声同时保持较大步幅的优化器。在训练 GPT-2 时,FOCUS 比 Signum 更稳定,速度更快于 Adam。这些结果表明,梯度噪声可能是 LLM 训练中被低估的限制因素,FOCUS 提供了有前景的解决方案。

关键词

引用

@article{arxiv.2501.12243,
  title  = {FOCUS: First Order Concentrated Updating Scheme},
  author = {Yizhou Liu and Ziming Liu and Jeff Gore},
  journal= {arXiv preprint arXiv:2501.12243},
  year   = {2025}
}

备注

19 pages, 8 figures