评估Chinchilla计算最优标度的鲁棒性
机器学习
2025-09-30 v1
摘要
Hoffman 等人(2022)提出的Chinchilla论文引入了计算最优标度的原则,为未来的语言模型标度奠定了基础。然而,随着时间的推移,人们对Chinchilla提出了有效顾虑:信心区间宽泛、其三种方法之间的差异,以及与其他标度规律之间的不一致。这引发了一个关键问题:实践者是否仍能依赖Chinchilla的建议?我们的工作证明了答案是肯定的。我们首先发现,Chinchilla分析中核心的模型参数是模糊的:可能有三种解释,不同解释之间的相对差异最高可达15.2%。我们发现,或许出乎意料的是,选择哪种模型参数用于分析并不显著影响关键结果:标度规律估计和计算最优token到参数比率。事实上,在一种解释下,token到参数比率随目标计算预算的增大而趋于更为恒定。随后,我们询问Chinchilla模型参数在没有显著影响关键结果的前提下可能被扭曲到什么程度。通过有意识地以四种结构化方式扰动模型参数,我们发现Chinchilla的关键结果对加性或系统性误差最敏感,这些误差可以改变原本平坦的最优token到参数比率趋势,但总体而言,Chinchilla的关键结果能够抵御可观的扰动。总体而言,我们的发现为该领域提供了对Chinchilla作为扩大语言模型标度可靠指南的 renewed confidence(再次信心)。
引用
@article{arxiv.2509.23963,
title = {Evaluating the Robustness of Chinchilla Compute-Optimal Scaling},
author = {Rylan Schaeffer and Noam Levi and Andreas Kirsch and Theo Guenais and Brando Miranda and Elyas Obbad and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2509.23963},
year = {2025}
}