多语言幻觉基准:MultiWikiQHalluA
计算与语言
2026-05-05 v1
摘要
大多数幻觉评估聚焦于英文,导致难以判断发现是否可迁移到低资源语言。我们研究忠实性幻觉,即模型生成的内容流畅且合理,但偏离提供的输入或内部不一致。利用多语言 MultiWikiQA 数据集,我们采用 LettuceDetect 框架为 306 种语言创建合成幻觉数据集,并为 30 种欧洲语言训练词级幻觉分类器。本文我们对选定语言(英文、丹麦语、德语和冰岛语)上的模型幻觉进行评估。我们的分类器揭示了 Qwen3-0.6B 在冰岛语等语言中幻觉率最高(达到 60% 的答案包含至少一个幻觉),而更大模型通常表现更低,cogito-v1-preview-qwen-32B 和 cogito-v1-preview-llama-70B 在大多数语言上表现最佳。幻觉率在低资源语言中一致更高,尤其是冰岛语。
引用
@article{arxiv.2605.02504,
title = {A multilingual hallucination benchmark: MultiWikiQHalluA},
author = {Freja Thoresen and Dan Saattrup Smart},
journal= {arXiv preprint arXiv:2605.02504},
year = {2026}
}
备注
Camera-ready version for RESOURCEFUL 2026