幻觉的现象学
人工智能
2026-03-17 v1 计算与语言
机器学习
摘要
我们表明,语言模型产生幻觉并非因为它们未能检测到不确定性,而是因为未能将其整合到输出生成中。在各种架构中,不确定的输入能够被可靠地识别,占据高维区域,其内蕴维度是事实性输入的 2-3 倍。然而,这一内部信号与输出层的耦合较弱:不确定性迁移到低敏感子空间,在几何上被放大但在功能上保持沉默。拓扑分析表明,不确定性表征发生碎片化而非收敛到统一的放弃状态,而梯度和 Fisher 探针揭示了沿不确定性方向的敏感度坍缩。由于交叉熵训练不为放弃提供吸引子,并均匀地奖励自信预测,关联机制将这些碎片化激活放大,直到残余耦合迫使产生一个确定性输出,尽管内部已经检测到不确定性。因果干预通过将不确定性与 logits 直接连接来恢复拒绝行为,从而证实了这一解释。
引用
@article{arxiv.2603.13911,
title = {The Phenomenology of Hallucinations},
author = {Valeria Ruscio and Keiran Thompson},
journal= {arXiv preprint arXiv:2603.13911},
year = {2026}
}