中文

重思考 LLM 幻觉检测的评估:一套期望、全新的基于 RAG 的基准及新发现

人工智能 2026-05-13 v1

摘要

幻觉现象广义指 LLM 生成的不忠实、虚构或不一致内容,具有广泛影响。因此,大量工作致力于检测 LLM 幻觉以及设计用于评估这些检测器的基准数据集。本文首先确立了有效评估幻觉检测基准(HDB)应具备的期望属性。通过我们建立的期望视角对现有 HDB 进行批判性审视,发现它们均未具备所有期望属性。我们识别出两个最大差距:(1) 基于 RAG 的 grounding 基准缺乏长上下文(部分原因是长度妨碍人工标注);(2) 现有基准未提供真实世界标签噪声以进行压力测试,尽管实际应用场景常面临因人工或自动/弱标注导致的标签噪声。为弥合这一差距,我们构建并开源了一个新的基于 RAG 的 HDB,称为 T RIVIA+,经严格的人工标注过程。值得注意的是,我们的基准具备所有理想属性,包括 (1) T RIVIA+ 包含文献中最长的上下文;(2) 我们设计并共享四套不同噪声标签,包含 sample-dependent 和 sample-independent 两种噪声方案。最后,我们在包含 T RIVIA+ 在内的 RAG-based HDB 上进行实验,使用流行的 SOTA 检测器揭示了新发现:(i) 当前检测器在 RAG-based HDB 上仍有显著提升空间;(ii) 基本的 LLM-as-a-Judge 基线性能相当竞争;(iii) 标签噪声会阻碍检测性能。我们期望这些发现以及提出的新基准将激励并推动针对 RAG 任务幻觉检测的必要研究。

关键词

引用

@article{arxiv.2605.11330,
  title  = {Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights},
  author = {Wenbo Chen and Veena Padmanabhan and Tootiya Giyahchi and Elaine Wong and Leman Akoglu},
  journal= {arXiv preprint arXiv:2605.11330},
  year   = {2026}
}

备注

ACL 2026 main conference