幻觉破坏信任;元认知是前进之路
计算与语言
2026-05-05 v1
摘要
尽管在事实可靠性方面取得了显著进展,但错误(通常被称为幻觉)仍然是生成式AI的一个主要问题,尤其是在LLM被期望在更复杂或更细微的场景中提供帮助的情况下。然而,即使在最简单的设置中——即具有明确真实答案的事实性问答——没有外部工具的前沿模型仍然会产生幻觉。我们认为,该领域的大部分事实性提升来自于扩展模型的知识边界(编码更多事实),而不是提高对该边界的意识(区分已知与未知)。我们推测后者本质上是困难的:模型可能缺乏完美区分真相与错误的判别能力,从而在消除幻觉和保持实用性之间产生不可避免的权衡。这种权衡在另一种框架下会消失。如果我们把幻觉理解为自信的错误——即没有适当限定的错误信息——那么在“回答或放弃”的二分法之外,出现了第三条路径:表达不确定性。我们提出忠实的不确定性:将语言上的不确定性与内在的不确定性对齐。这是元认知的一个方面——即意识到自身不确定性并据此采取行动的能力。对于直接交互,对不确定性采取行动意味着诚实地传达它;对于智能体系统,它成为控制层,决定何时搜索以及信任什么。因此,元认知对于LLM既值得信赖又具备能力至关重要;最后,我们强调了为实现这一目标而存在的开放性问题。
引用
@article{arxiv.2605.01428,
title = {Hallucinations Undermine Trust; Metacognition is a Way Forward},
author = {Gal Yona and Mor Geva and Yossi Matias},
journal= {arXiv preprint arXiv:2605.01428},
year = {2026}
}
备注
To appear in ICML 2026 (Position Track)