大语言模型中上下文长度缩放的内禀熵
机器学习
2026-03-03 v4 计算与语言
摘要
长上下文语言模型在过去几年中引起了极大关注。已有工作讨论了长上下文对语言模型性能的影响:一些研究发现不相关的长上下文可能损害性能,而另一些则通过实验将相关长上下文带来的损失降低总结为缩放定律。这要求我们更深入地理解长上下文如何影响语言建模。在这项工作中,我们(1)提出使用“内禀熵”来解释上下文长度对语言建模的影响;(2)在自然语言和合成数据上进行实验,验证了我们提出的理论假设和推论。我们的理论框架可以提供实用的见解,例如确定训练数据集大小决定了最优上下文长度,并在某些情况下限制了上下文长度的缩放。我们希望我们的工作能启发新的长上下文语言模型,以及未来研究语言模型物理学的工作。
引用
@article{arxiv.2502.01481,
title = {Intrinsic Entropy of Context Length Scaling in LLMs},
author = {Jingzhe Shi and Qinwei Ma and Hongyi Liu and Hang Zhao and Jeng-Neng Hwang and Lei Li},
journal= {arXiv preprint arXiv:2502.01481},
year = {2026}
}
备注
36 pages, 18 figures, 2 tables