中文

语言模型扩展规律背后的训练动力学:损失减缓与零和学习

机器学习 2025-07-16 v2 人工智能

摘要

本工作旨在理解通过规模化如何改进语言模型,特别是从训练动力学角度进行分析。我们发现,语言模型在训练初期会出现损失减缓现象;即损失改进速度的急剧放缓,导致损失曲线在对数坐标图中呈现分段线性行为。规模化提升模型可通过两个方面缓解这一转变:(1)降低损失减缓发生的阈值;(2)改善损失减缓之后的对数坐标损失改进率。我们将损失减缓归因于一种称为零和学习(ZSL)的退化训练动力学。在 ZSL 中,单样本梯度系统性地相互矛盾,导致单样本损失变化的毁灭性干扰。结果是,提高某类样本集合上损失会损害另一类样本集合上的损失,从而形成瓶颈,限制了整体进展。损失减缓与 ZSL 为语言模型扩展规律背后的训练动力学提供了新视角,且可能直接针对这些现象以独立于规模的方式提升语言模型。我们在 https://github.com/mirandrom/zsl 公开代码与相关资源。

关键词

引用

@article{arxiv.2506.05447,
  title  = {Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning},
  author = {Andrei Mircea and Supriyo Chakraborty and Nima Chitsazan and Milind Naphade and Sambit Sahu and Irina Rish and Ekaterina Lobacheva},
  journal= {arXiv preprint arXiv:2506.05447},
  year   = {2025}
}

备注

Published as a conference paper at ACL 2025