面向低资源语言对话中的幻觉现象调查
计算与语言
2025-11-20 v2
摘要
大型语言模型 (LLM) 已在生成逼近人类写作的文本方面展现出惊人的能力。然而,它们常常生成事实错误的陈述,通常称为“幻觉”。针对幻觉问题的研究对于增强 LLM 的可靠性和有效性至关重要。虽然已有大量研究聚焦于英文中的幻觉问题,但本研究将此调查扩展到三种语言的对话数据:印地语、菲斯希语和汉语。我们提供了对数据集的全面分析,以检视这些语言中 GPT-3.5、GPT-4o、Llama-3.1、Gemma-2.0、DeepSeek-R1 和 Qwen-3 在事实错误和语言错误方面的表现。我们发现 LLM 在汉语中几乎不会产生幻觉响应,但在印地语和菲斯希语中生成的幻觉数量显著更高。
引用
@article{arxiv.2507.22720,
title = {Investigating Hallucination in Conversations for Low Resource Languages},
author = {Amit Das and Md. Najib Hasan and Souvika Sarkar and Zheng Zhang and Fatemeh Jamshidi and Tathagata Bhattacharya and Nilanjana Raychawdhury and Dongji Feng and Vinija Jain and Aman Chadha},
journal= {arXiv preprint arXiv:2507.22720},
year = {2025}
}