大语言模型规模化的根本限制
机器学习
2026-01-27 v2 人工智能
分布式、并行与集群计算
信息论
多智能体系统
math.IT
摘要
大语言模型 (LLMs) 尽管从规模化方面取得了巨大收益,但这些收益受到五个根本性限制的约束:(1)幻觉现象,(2)上下文压缩,(3)推理退化,(4)检索脆弱性,(5)多模态错位。虽然现有调查书籍经验性地描述了这些现象,但缺乏将其与计算、信息和学习的根本限制相联系的严谨理论综合。本工作通过提出一种统一且以证明为导向的框架,填补了这一空白,形式化了大语言模型规模化的内在理论上限。首先,计算性与不可计算性意味着一种不可消除的误差残留:对于任何可列举的模型族,对角化操作保证在某些输入上至少有一个模型必须失败,而不可判定查询(如 halting 式任务)会导致所有可计算预测器的无限失败集合。其次,信息论和统计约束即使在可判定任务上也限制了可达的准确性,有限描述长度强制压缩误差,而长尾事实知识需要高昂的样本复杂度。此外,几何和计算效应由于位置训练不足、编码衰减和 softmax 拥挤,使长上下文压缩远低于其名义大小。我们进一步展示了基于概率的训练如何偏好模式完成而非推理,检索在 token 限制下受到语义漂移和耦合噪声的影响,多模态规模继承了浅层跨模态对齐。跨各章节,我们结合定理与实证证据,概述了规模化在何处有益、何处饱和以及何处无法继续推进,从而提供理论基础以及如受限 oracle 检索、位置课程和稀疏或层次注意力等实用缓解方案。
引用
@article{arxiv.2511.12869,
title = {On the Fundamental Limits of LLMs at Scale},
author = {Muhammad Ahmed Mohsin and Muhammad Umer and Ahsan Bilal and Zeeshan Memon and Muhammad Ibtsaam Qadir and Sagnik Bhattacharya and Hassan Rizwan and Abhiram R. Gorle and Maahe Zehra Kazmi and Nukhba Amir and Ali Subhan and Muhammad Usman Rafique and Zihao He and Pulkit Mehta and Muhammad Ali Jamshed and John M. Cioffi},
journal= {arXiv preprint arXiv:2511.12869},
year = {2026}
}
备注
Submitted to TMLR 2025