中文

Halluverse-M^3:面向 LLM 幻觉的多任务多语言基准

计算与语言 2026-02-09 v1 人工智能

摘要

大语言模型中的幻觉仍是一个持续的挑战,尤其是在多语言和生成环境下,更难维持事实一致性。虽然最近的模型在以英语为中心的基准测试中表现良好,但其在不同语言、任务和幻觉类型下的行为尚不为人所了解。本文引入 Halluverse-M^3,一个设计用于系统性分析跨多语言、多任务、多幻觉类别幻觉的数据集。Halluverse-M^3 涵盖四种语言:英语、阿拉伯语、印地语和土耳其语,支持两种生成任务:问答和对话摘要。数据集明确区分了实体级、关系级和句子级幻觉。通过受控编辑过程构建的幻觉输出经人工标注者验证,确保原始内容与生成内容之间存在明确的对齐。使用该数据集,我们评估了当代多样化的开源和专有语言模型在细粒度幻觉检测方面的表现。我们的结果表明,问答任务始终比对话摘要更容易,而且即使是最强的模型在句子级幻觉检测方面仍具有挑战性。性能在英语中最高,在资源较少的语言中下降,印地语的检测准确率最低。总体而言,Halluverse-M^3 提供了一个真实且具有挑战性的基准,用于研究多语言、多任务环境下的幻觉。我们发布该数据集以支持未来研究。

关键词

引用

@article{arxiv.2602.06920,
  title  = {Halluverse-M^3: A multitask multilingual benchmark for hallucination in LLMs},
  author = {Samir Abdaljalil and Parichit Sharma and Erchin Serpedin and Hasan Kurban},
  journal= {arXiv preprint arXiv:2602.06920},
  year   = {2026}
}