多语言生成中的幻觉检测指标比较
计算与语言
2024-06-18 v2 人工智能
摘要
虽然许多幻觉检测技术已在英文文本上得到评估,但它们在多语言环境中的有效性仍然未知。本文评估了各种事实性幻觉检测指标(如 ROUGE 和命名实体重叠等词汇指标,以及基于自然语言推理 (NLI) 的指标)在跨语言生成的传记摘要中识别幻觉的效果。我们比较了自动指标之间的相关性,以及它们是否与人类对事实性的判断一致。我们的分析表明,虽然词汇指标效果不佳,但基于 NLI 的指标表现良好,在许多设置中与人类标注相关,且往往优于监督模型。然而,NLI 指标仍有局限性,因为它们无法很好地检测单一事实幻觉,且在低资源语言中会失效。因此,我们的发现突显了现有非英语语言幻觉检测方法的差距,并激励未来研究开发更 robust 的多语言大语言模型 (LLM) 幻觉检测方法。
引用
@article{arxiv.2402.10496,
title = {Comparing Hallucination Detection Metrics for Multilingual Generation},
author = {Haoqiang Kang and Terra Blevins and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:2402.10496},
year = {2024}
}