中文

交叉熵比例定律中值尺度是什么?

机器学习 2026-03-03 v2 人工智能 计算与语言

摘要

交叉熵比例定律长期以来一直是指导大型语言模型开发的关键工具。它表明,随着模型规模增加,交叉熵损失以可预测的幂律速率下降。然而,近期证据表明,这一定律在非常大的尺度上会失效:损失下降的速度比预期慢,这给大型语言模型的开发带来了显著困难。本文我们假设,根本原因在于交叉熵本身并不真正呈比例尺度;相反,只有它的一个隐藏组成部分才如此。为检验这一假设,我们提出一种将交叉熵分解为三个部分的新方法:误差熵(Error-Entropy)、自对齐(Self-Alignment)和置信度(Confidence)。我们在理论和实证方面都证明,这种分解精确地捕捉了训练动力学和优化目标。通过在多个数据集上对 32 个跨越五个数量级模型进行大量实验,我们发现只有误差熵遵循稳健的比例尺度定律,而另外两个术语基本不变。此外,误差熵在小模型中占据交叉熵的主导份额,但随着模型规模增大而逐渐下降。这解释了为何交叉熵比例尺度定律在小尺度下看起来准确,但在非常大尺度下却失败。我们的发现将误差熵比例尺度定律确立为更准确描述模型行为的新定律。我们相信这将在大型语言模型的训练、理解及未来开发中具有广泛应用前景。

关键词

引用

@article{arxiv.2510.04067,
  title  = {What Scales in Cross-Entropy Scaling Law?},
  author = {Junxi Yan and Zixi Wei and Qingyao Ai and Yiqun Liu and Jingtao Zhan},
  journal= {arXiv preprint arXiv:2510.04067},
  year   = {2026}
}