中文

大语言模型与英语的熵

统计力学 2026-01-01 v1 计算与语言 生物物理 神经元与认知

摘要

我们利用大语言模型 (LLM) 从多种来源的英文文本中揭示长程结构。许多情况下,条件熵或代码长度随上下文长度至少保持下降,直到 N104N\sim 10^4 字符,这表明存在跨这些距离的直接依赖或相互作用。其推论是字符在这些距离上的小但显著相关性,如我们从数据中独立于模型显示。代码长度分布揭示了随着 NN 增大,越来越大比例字符的确定性。我们在模型训练过程中观察到长短情境长度下的不同动力学,表明长程结构仅在渐进中被学习。我们的结果约束了构建 LLM 或语言本身统计物理模型的努力。

关键词

引用

@article{arxiv.2512.24969,
  title  = {Large language models and the entropy of English},
  author = {Colin Scheibner and Lindsay M. Smith and William Bialek},
  journal= {arXiv preprint arXiv:2512.24969},
  year   = {2026}
}

备注

8 pages, 6 figures