LLM 跨语言幻觉现象:多语言幻觉估计的现实考量
计算与语言
2026-02-03 v4 人工智能
摘要
在信息不实时代,幻觉——即大型语言模型(LLM)生成非事实或不忠实响应的倾向——代表其全球效用的主要风险。尽管 LLM 正变得越来越多语言化,但关于检测和量化 LLM 幻觉的绝大部分研究是(a)以英语为中心,且(b)聚焦机器翻译(MT)和摘要等在现实场景中不常见的任务,而非开放信息检索。相反,我们旨在跨语言量化 LLM 在知识密集型长篇问答(LFQA)中的幻觉程度。为此,我们训练了一个多语言幻觉检测模型,并进行大规模研究,覆盖 30 种语言和 6 个开源 LLM 家族。我们从英语幻觉检测数据集出发,依赖机器翻译来训练检测模型。我们还手动标注了五个高资源语言的金数据;随后我们证明,就这些语言而言,银数据(LLM 生成)与金标准测试集之间的幻觉率估计相似,验证了使用银数据估计其他语言幻觉率的可行性。最终,我们为 30 种语言构建了开放域问答数据集,LLM 生成的提示词作为问题,维基百科文章作为参考。我们的分析表明,LLM 在绝对意义上,因响应较长,导致高资源语言中生成的 token 数更多,但实际的幻觉率(即按长度标准化后)似乎与语言数字足迹的大小无关。我们还发现,较小的 LLM 幻觉更严重,且支持更广泛语言的 LLM 显示出更高的幻觉率。
引用
@article{arxiv.2502.12769,
title = {How Much Do LLMs Hallucinate across Languages? On Realistic Multilingual Estimation of LLM Hallucination},
author = {Saad Obaid ul Islam and Anne Lauscher and Goran Glavaš},
journal= {arXiv preprint arXiv:2502.12769},
year = {2026}
}
备注
EMNLP 2025