最优标度需要最优范数
机器学习
2026-01-28 v2 人工智能
机器学习
摘要
尽管近期在模型和数据规模下的最优超参数迁移方面取得了进展,但尚未建立统一的解释原则。对于 Adam 和 Scion 优化器,我们发现模型和数据规模上的联合最优标度取决于一个单一不变式:输出层的算子范数。在规模可达 1380 亿 token、参数可达 138 亿的参数的模型中,最优学习率/批量大小配对 始终具有相同的算子范数值——我们称之为范数迁移(norm transfer)。这种恒定范数条件是必要但不充分的:尽管对于每个数据规模,多个 都能达到最优范数,但只有唯一的 才能实现最佳损失。作为充分条件,我们提供了 Scion 的 随数据规模扩展规则的首次测量,发现其扩展规则与 Adam 的一致。按层组调整学习率也能改善模型性能,其中输出层最为敏感,隐藏层受益于较低的学习率。我们提供了关于范数引导的最优标度的实用见解,并发布了我们的分布式 Scion(Disco)实现,包含来自超过两千次运行的日志,以支持规模化 LLM 训练动力学的研究。
引用
@article{arxiv.2510.03871,
title = {Optimal Scaling Needs Optimal Norm},
author = {Oleg Filatov and Jiangtao Wang and Jan Ebert and Stefan Kesselheim},
journal= {arXiv preprint arXiv:2510.03871},
year = {2026}
}