大型语言模型中 hallucination 控制的根本不可实现性
机器学习
2025-10-17 v7 人工智能
计算与语言
计算机科学与博弈论
机器学习
摘要
本文提出根本不可能定理:任何执行非平凡知识聚合的大型语言模型,都无法同时实现真实知识表征、语义信息守恒、相关知识的完整披露以及知识约束的最优性。这一不可实现性源于信息聚合的数学结构,而非工程限制。我们通过将推理建模为思想的拍卖,分布式组件竞争以利用其编码知识影响响应来进行证明。该证明采用三种独立方法:机制设计(Green-Laffont 定理)、proper scoring rules(Savage)以及 Transformer 架构分析(log-sum-exp 凸性)。我们引入语义信息度量和涌现算子以分析受计算限制且无计算限制的推理。受限推理使潜在信息可访问,实现渐进式洞见和创造力;而无计算限制的推理使所有可派生知识立即可及,同时保持语义内容。我们证明了守恒-推理二分法:有意义的推理必然违反信息守恒。我们的框架表明,hallucination 与想象在数学上是相同的,两者均违反上述四项基本属性之一。Transformer 注意力中的 Jensen 间隙量化了这种违反,作为超出组成证据的过度置信度。该统一视角解释了为何高效模型必须在真实性与创造性之间进行权衡。这些结果为在 AI 系统中管理 hallucination 权衡提供了原则性基础。我们不应消除 hallucination,而应针对特定应用优化这些必然的权衡。我们以哲学意义将此不可实现性与理性的根本限制相联系。
引用
@article{arxiv.2506.06382,
title = {On the Fundamental Impossibility of Hallucination Control in Large Language Models},
author = {Michał P. Karpowicz},
journal= {arXiv preprint arXiv:2506.06382},
year = {2025}
}
备注
Mathematics debugged: added examples, corrected transformer example, re-edited, typos removed