中文

SelfCheck-Eval:面向大语言模型的零资源幻觉检测多模块框架

计算与语言 2025-12-30 v2 机器学习

摘要

大语言模型(LLMs)在从开放域问答到科学写作、医疗决策支持和法律分析等多样化应用中展现了卓越的能力。然而,它们倾向于生成不正确或虚构的内容(通常称为幻觉),这构成了在高风险领域可靠部署的关键障碍。当前的幻觉检测基准范围有限,主要集中在通用知识领域,而忽视了准确性至关重要的专业领域。为了解决这一差距,我们引入了AIME数学幻觉数据集,这是第一个专门为评估数学推理幻觉而设计的综合基准。此外,我们提出了SelfCheck-Eval,一个与LLM无关的黑盒幻觉检测框架,适用于开源和闭源LLM。我们的方法利用了一种新颖的多模块架构,集成了三种独立的检测策略:语义模块、专门检测模块和上下文一致性模块。我们的评估揭示了跨领域的系统性性能差异:现有方法在传记内容上表现良好,但在数学推理方面表现挣扎,这一挑战在自然语言推理微调、偏好学习和过程监督方法中持续存在。这些发现突显了当前检测方法在数学领域的根本局限性,并强调了为确保可靠的LLM部署而需要专门的、黑盒兼容方法的迫切性。

关键词

引用

@article{arxiv.2502.01812,
  title  = {SelfCheck-Eval: A Multi-Module Framework for Zero-Resource Hallucination Detection in Large Language Models},
  author = {Diyana Muhammed and Giusy Giulia Tuccari and Gollam Rabby and Sören Auer and Sahar Vahdati},
  journal= {arXiv preprint arXiv:2502.01812},
  year   = {2025}
}