语言模型扩展规律背后的训练动力学:损失减缓与零和学习
机器学习
2025-07-16 v2 人工智能
摘要
本工作旨在理解通过规模化如何改进语言模型,特别是从训练动力学角度进行分析。我们发现,语言模型在训练初期会出现损失减缓现象;即损失改进速度的急剧放缓,导致损失曲线在对数坐标图中呈现分段线性行为。规模化提升模型可通过两个方面缓解这一转变:(1)降低损失减缓发生的阈值;(2)改善损失减缓之后的对数坐标损失改进率。我们将损失减缓归因于一种称为零和学习(ZSL)的退化训练动力学。在 ZSL 中,单样本梯度系统性地相互矛盾,导致单样本损失变化的毁灭性干扰。结果是,提高某类样本集合上损失会损害另一类样本集合上的损失,从而形成瓶颈,限制了整体进展。损失减缓与 ZSL 为语言模型扩展规律背后的训练动力学提供了新视角,且可能直接针对这些现象以独立于规模的方式提升语言模型。我们在 https://github.com/mirandrom/zsl 公开代码与相关资源。
引用
@article{arxiv.2506.05447,
title = {Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning},
author = {Andrei Mircea and Supriyo Chakraborty and Nima Chitsazan and Milind Naphade and Sambit Sahu and Irina Rish and Ekaterina Lobacheva},
journal= {arXiv preprint arXiv:2506.05447},
year = {2025}
}
备注
Published as a conference paper at ACL 2025