中文

语义幻觉:基于嵌入的RAG系统幻觉检测的认证极限

机器学习 2025-12-22 v2 人工智能 计算与语言

摘要

检索增强生成(RAG)系统尽管基于检索证据仍然容易产生幻觉。虽然当前检测方法利用嵌入相似性和自然语言推理(NLI),但其在安全关键环境中的可靠性尚未得到证明。我们将保守预测应用于RAG幻觉检测,将启发式得分转化为具有有限样本覆盖保证(1-α)的决策集。使用n=600的校准集,我们展示了一个根本性二分法:在合成幻觉(Natural Questions)上,嵌入方法在95%覆盖率下实现0%假阳性率(FPR)。然而,在来自RLHF对齐模型的真实幻觉(HaluEval)上,相同方法会 catastrophic 失败,导致在目标覆盖率下的100% FPR。我们通过分布尾部的视角分析这种失败,表明虽然NLI模型实现了可接受的AUC(0.81),但"最难"的幻觉在语义上几乎不可区分于忠实响应,迫使保守阈值拒绝近乎所有有效输出。关键在于,GPT-4作为裁判在相同数据上实现7% FPR(95% CI:[3.4%, 13.7%]),证明该任务可以通过推理解决但对表层语义不透明——我们称之为"语义幻觉"。

关键词

引用

@article{arxiv.2512.15068,
  title  = {The Semantic Illusion: Certified Limits of Embedding-Based Hallucination Detection in RAG Systems},
  author = {Debu Sinha},
  journal= {arXiv preprint arXiv:2512.15068},
  year   = {2025}
}

备注

12 pages, 3 figures, 5 tables