中文

对抗幻觉的界限:基于 Merlin-Arthur 协议的 RAG 系统信息论保证

计算与语言 2026-02-02 v2 人工智能 机器学习

摘要

检索增强生成(RAG)依赖于检索上下文来指导大型语言模型(LLM),但将检索视为弱启发式而非可验证证据,导致生成不支持的答案、幻觉以及对虚假上下文的依赖。我们引入一种新型训练框架,将 RAG 流程视为交互式证明系统,通过适配 Merlin-Arthur(M/A)协议实现:Arthur(生成器 LLM)在未知上下文来源的问题上进行训练,Merlin 提供有帮助的证据,而 Morgana 注入对抗性、误导性的上下文。两者都使用 XAI 方法识别并修改最影响 Arthur 的证据。这训练 Arthur 能够:(1)在证据支持答案时作答、(2)在证据不足时拒绝、(3)依赖真正支撑答案的上下文片段。我们进一步引入一个验证框架,使解释忠诚度与模型预测误差分离,并引入解释信息分数(EIF),归一化 M/A 互信息保证。在三个 RAG 数据集和多个 LLM 家族和规模上,M/A 训练使 LLM 更可靠地依赖证据,提高信息论指标(soundness、completeness)和拒绝行为,幻觉减少,且无需手动标注不可回答样本。最后,检索器通过自动生成的 M/A hard positives 和 negatives 也会提高召回率和 MRR。虽然高准确率不保证上下文到答案的熵流,但我们的 EIF 结果表明,自主式交互式证明式监督使 RAG 系统能够将检索文档视为可验证证据。

关键词

引用

@article{arxiv.2512.11614,
  title  = {Bounding Hallucinations: Information-Theoretic Guarantees for RAG Systems via Merlin-Arthur Protocols},
  author = {Björn Deiseroth and Max Henning Höth and Kristian Kersting and Letitia Parcalabescu},
  journal= {arXiv preprint arXiv:2512.11614},
  year   = {2026}
}

备注

31 pages, 22 figures