中文

HalluMix:面向真实世界幻觉检测的任务无关多领域基准

计算与语言 2025-05-02 v1 人工智能

摘要

随着大语言模型(LLM)越来越多地被部署在高风险领域,检测幻觉内容——即没有支持性证据支撑的文本——已成为一项关键挑战。现有的幻觉检测基准通常是合成生成的,狭隘地聚焦于抽取式问答,未能捕捉涉及多文档上下文和全句输出的真实世界场景的复杂性。我们引入了 HalluMix 基准,这是一个多样化的、任务无关的数据集,包含来自不同领域和格式的示例。使用该基准,我们评估了七个幻觉检测系统——包括开源和闭源系统——突出了不同任务、文档长度和输入表示之间的性能差异。我们的分析突出了短上下文和长上下文之间的巨大性能差异,对真实世界的检索增强生成(RAG)实现具有关键意义。Quotient Detections 取得了最佳的整体性能,准确率为 0.82,F1 分数为 0.84。

关键词

引用

@article{arxiv.2505.00506,
  title  = {HalluMix: A Task-Agnostic, Multi-Domain Benchmark for Real-World Hallucination Detection},
  author = {Deanna Emery and Michael Goitia and Freddie Vargus and Iulia Neagu},
  journal= {arXiv preprint arXiv:2505.00506},
  year   = {2025}
}