中文

LLM 作为带噪声的信道:模型容量与规模定律的香港视角

机器学习 2026-05-25 v1 人工智能 信息论 math.IT

摘要

现有的大型语言模型(LLM)规模定律主要是单调幂律,无法解释诸如灾难性过训练和量化引起的性能下降等非单调现象,即使计算资源增加,性能仍恶化。我们提出香港规模定律,一个统一的理论框架,将 LLM 训练建模为香港定理下的信道传输,模型参数映射为信道带宽,训练标记映射为信号功率。我们的公式显式地捕捉了学习信号与固有噪声之间的相互作用,从而揭示了 LLM 的根本香港容量:若不保持充分的信噪比(SNR),无论是扩大模型规模还是数据量,都不可避免地放大噪声,引发从单调提升向 U 形性能退化的转变。我们通过在 Pythia 和 OLMo2 上进行实验验证,包括高斯噪声、量化和在数学、问答和代码任务上的监督微调。香港规模定律在 R2R^2 分数上持续优于经典规模定律和最近的感知噪声定律,准确捕捉到先前方法所忽略的损失盆地。该模型还能外推:在 \leq69B 参数的 Pythia 模型上训练 \leq180B 个标记,即可准确预测未见的 12B 模型在 307B 个标记上的表现, pooled R2=0.847R^2{=}0.847,而单调基线则崩溃。

关键词

引用

@article{arxiv.2605.23901,
  title  = {LLMs as Noisy Channels: A Shannon Perspective on Model Capacity and Scaling Laws},
  author = {Xu Ouyang and Deyi Liu and Yuhang Cai and Jing Liu and Yuan Yang and Chen Zheng and Thomas Hartvigsen and Yiyuan Ma},
  journal= {arXiv preprint arXiv:2605.23901},
  year   = {2026}
}

备注

Accepted by ICML 2026