中文

Poly-FEVER:面向大语言模型幻觉检测的多语言事实核查基准

计算与语言 2025-03-28 v2

摘要

生成式人工智能中的幻觉,特别是大型语言模型(LLM)中的幻觉,对多语言应用的可靠性构成了重大挑战。现有的幻觉检测基准主要关注英语和少数广泛使用的语言,缺乏评估模型在多样化语言环境中性能不一致性的广度。为填补这一空白,我们引入了 Poly-FEVER,这是一个大规模多语言事实核查基准,专门用于评估 LLM 中的幻觉检测。Poly-FEVER 包含 77,973 个标注事实声明,涵盖 11 种语言,来源于 FEVER、Climate-FEVER 和 SciFact。它提供了第一个专门用于分析跨语言幻觉模式的大规模数据集,使 ChatGPT 和 LLaMA 系列等 LLM 的系统评估成为可能。我们的分析揭示了主题分布和网络资源可用性如何影响幻觉频率,揭示了影响模型准确性的语言特定偏差。通过提供多语言事实核查基准,Poly-FEVER 促进了幻觉检测的跨语言比较,并有助于开发更可靠、语言包容性更强的 AI 系统。该数据集公开发布,以推动负责任 AI、事实核查方法和多语言 NLP 领域的研究,促进 LLM 性能的更高透明度和鲁棒性。提出的 Poly-FEVER 可在以下网址获取:https://huggingface.co/datasets/HanzhiZhang/Poly-FEVER。

关键词

引用

@article{arxiv.2503.16541,
  title  = {Poly-FEVER: A Multilingual Fact Verification Benchmark for Hallucination Detection in Large Language Models},
  author = {Hanzhi Zhang and Sumera Anjum and Heng Fan and Weijian Zheng and Yan Huang and Yunhe Feng},
  journal= {arXiv preprint arXiv:2503.16541},
  year   = {2025}
}