中文

最优标度需要最优范数

机器学习 2026-01-28 v2 人工智能 机器学习

摘要

尽管近期在模型和数据规模下的最优超参数迁移方面取得了进展,但尚未建立统一的解释原则。对于 Adam 和 Scion 优化器,我们发现模型和数据规模上的联合最优标度取决于一个单一不变式:输出层的算子范数。在规模可达 1380 亿 token、参数可达 138 亿的参数的模型中,最优学习率/批量大小配对 (η,B)(\eta^{\ast}, B^{\ast}) 始终具有相同的算子范数值——我们称之为范数迁移(norm transfer)。这种恒定范数条件是必要但不充分的:尽管对于每个数据规模,多个 (η,B)(\eta, B) 都能达到最优范数,但只有唯一的 (η,B)(\eta^{\ast}, B^{\ast}) 才能实现最佳损失。作为充分条件,我们提供了 Scion 的 (η,B)(\eta^{\ast}, B^{\ast}) 随数据规模扩展规则的首次测量,发现其扩展规则与 Adam 的一致。按层组调整学习率也能改善模型性能,其中输出层最为敏感,隐藏层受益于较低的学习率。我们提供了关于范数引导的最优标度的实用见解,并发布了我们的分布式 Scion(Disco)实现,包含来自超过两千次运行的日志,以支持规模化 LLM 训练动力学的研究。

关键词

引用

@article{arxiv.2510.03871,
  title  = {Optimal Scaling Needs Optimal Norm},
  author = {Oleg Filatov and Jiangtao Wang and Jan Ebert and Stefan Kesselheim},
  journal= {arXiv preprint arXiv:2510.03871},
  year   = {2026}
}