大语言模型与英语的熵
统计力学
2026-01-01 v1 计算与语言
生物物理
神经元与认知
摘要
我们利用大语言模型 (LLM) 从多种来源的英文文本中揭示长程结构。许多情况下,条件熵或代码长度随上下文长度至少保持下降,直到 字符,这表明存在跨这些距离的直接依赖或相互作用。其推论是字符在这些距离上的小但显著相关性,如我们从数据中独立于模型显示。代码长度分布揭示了随着 增大,越来越大比例字符的确定性。我们在模型训练过程中观察到长短情境长度下的不同动力学,表明长程结构仅在渐进中被学习。我们的结果约束了构建 LLM 或语言本身统计物理模型的努力。
引用
@article{arxiv.2512.24969,
title = {Large language models and the entropy of English},
author = {Colin Scheibner and Lindsay M. Smith and William Bialek},
journal= {arXiv preprint arXiv:2512.24969},
year = {2026}
}
备注
8 pages, 6 figures