幻觉错觉:重新评估 LLM 中的幻觉检测
计算与语言
2025-08-15 v2 人工智能
机器学习
摘要
大型语言模型(LLM)在自然语言处理领域取得了突破性进展,但其倾向于生成幻觉信息(hallucination)为可靠部署带来了严峻挑战。尽管已有诸多幻觉检测方法,但其评估常依赖 ROUGE 指标——该指标基于词汇重叠,与人类判断存在偏离。通过大规模人类实证研究,我们展示尽管 ROUGE 在召回率上表现良好,但其极低的精确率导致对检测方法性能的估计误导。事实上,若采用人类对齐的评估标准如 LLM-as-Judge,多个既定检测方法的性能会下降最高达 45.9%。此外,我们的分析揭示,基于响应长度的简单启发式方法可与复杂检测技术相当,暴露了当前评估实践的根本性缺陷。我们认为,采用语义感知且鲁棒的评估框架至关重要,以准确把握幻觉检测方法的真实性能,最终确保 LLM 输出的可信度。
关键词
引用
@article{arxiv.2508.08285,
title = {The Illusion of Progress: Re-evaluating Hallucination Detection in LLMs},
author = {Denis Janiak and Jakub Binkowski and Albert Sawczyn and Bogdan Gabrys and Ravid Shwartz-Ziv and Tomasz Kajdanowicz},
journal= {arXiv preprint arXiv:2508.08285},
year = {2025}
}
备注
Preprint, under review