LLM 作为带噪声的信道:模型容量与规模定律的香港视角
机器学习
2026-05-25 v1 人工智能
信息论
math.IT
摘要
现有的大型语言模型(LLM)规模定律主要是单调幂律,无法解释诸如灾难性过训练和量化引起的性能下降等非单调现象,即使计算资源增加,性能仍恶化。我们提出香港规模定律,一个统一的理论框架,将 LLM 训练建模为香港定理下的信道传输,模型参数映射为信道带宽,训练标记映射为信号功率。我们的公式显式地捕捉了学习信号与固有噪声之间的相互作用,从而揭示了 LLM 的根本香港容量:若不保持充分的信噪比(SNR),无论是扩大模型规模还是数据量,都不可避免地放大噪声,引发从单调提升向 U 形性能退化的转变。我们通过在 Pythia 和 OLMo2 上进行实验验证,包括高斯噪声、量化和在数学、问答和代码任务上的监督微调。香港规模定律在 分数上持续优于经典规模定律和最近的感知噪声定律,准确捕捉到先前方法所忽略的损失盆地。该模型还能外推:在 69B 参数的 Pythia 模型上训练 180B 个标记,即可准确预测未见的 12B 模型在 307B 个标记上的表现, pooled ,而单调基线则崩溃。
引用
@article{arxiv.2605.23901,
title = {LLMs as Noisy Channels: A Shannon Perspective on Model Capacity and Scaling Laws},
author = {Xu Ouyang and Deyi Liu and Yuhang Cai and Jing Liu and Yuan Yang and Chen Zheng and Thomas Hartvigsen and Yiyuan Ma},
journal= {arXiv preprint arXiv:2605.23901},
year = {2026}
}
备注
Accepted by ICML 2026