中文

AraHalluEval:面向阿拉伯语 LLM 的细粒度幻觉评估框架

计算与语言 2025-09-10 v2

摘要

近期关于大语言模型(LLM)幻觉的大量研究主要集中于英语。尽管多语言和阿拉伯语专用 LLM 数量不断增长,但在阿拉伯语语境下评估 LLM 幻觉仍相对缺乏探索。鉴于阿拉伯语在许多地区的广泛使用及其在全球通信与媒体中的重要性,这一知识空白尤为紧迫。本文首次对阿拉伯语和多语言 LLM 在两项关键阿拉伯语自然语言生成任务——生成式问答(GQA)与摘要——上进行了全面的幻觉评估。本研究共评估了 12 个 LLM,包括 4 个阿拉伯语预训练模型、4 个多语言模型和 4 个基于推理的模型。为评估 LLM 输出的事实一致性与忠实度,我们开发了一个细粒度幻觉评估框架,包含 12 个细粒度幻觉指标,以表征各任务的不同特征。结果显示,在所有模型和任务中,事实幻觉比忠实度错误更为普遍。值得注意的是,阿拉伯语预训练模型 Allam 始终表现出低于多语言模型的幻觉率,并与基于推理的模型性能相当。代码可在:https://github.com/aishaalansari57/AraHalluEval 获取。

关键词

引用

@article{arxiv.2509.04656,
  title  = {AraHalluEval: A Fine-grained Hallucination Evaluation Framework for Arabic LLMs},
  author = {Aisha Alansari and Hamzah Luqman},
  journal= {arXiv preprint arXiv:2509.04656},
  year   = {2025}
}