中文

多语言幻觉基准:MultiWikiQHalluA

计算与语言 2026-05-05 v1

摘要

大多数幻觉评估聚焦于英文,导致难以判断发现是否可迁移到低资源语言。我们研究忠实性幻觉,即模型生成的内容流畅且合理,但偏离提供的输入或内部不一致。利用多语言 MultiWikiQA 数据集,我们采用 LettuceDetect 框架为 306 种语言创建合成幻觉数据集,并为 30 种欧洲语言训练词级幻觉分类器。本文我们对选定语言(英文、丹麦语、德语和冰岛语)上的模型幻觉进行评估。我们的分类器揭示了 Qwen3-0.6B 在冰岛语等语言中幻觉率最高(达到 60% 的答案包含至少一个幻觉),而更大模型通常表现更低,cogito-v1-preview-qwen-32B 和 cogito-v1-preview-llama-70B 在大多数语言上表现最佳。幻觉率在低资源语言中一致更高,尤其是冰岛语。

关键词

引用

@article{arxiv.2605.02504,
  title  = {A multilingual hallucination benchmark: MultiWikiQHalluA},
  author = {Freja Thoresen and Dan Saattrup Smart},
  journal= {arXiv preprint arXiv:2605.02504},
  year   = {2026}
}

备注

Camera-ready version for RESOURCEFUL 2026