HalluScore:大型语言模型幻觉问答基准
计算与语言
2026-05-19 v1
摘要
大型语言模型(LLMs)在自然语言生成方面取得了显著进展,但仍然容易产生幻觉。针对这一日益增长的担忧,已developed several benchmarks,主要在英语和中文方面。然而,阿拉伯语仍不受到足够关注,由于稀缺的标注资源和语言的形态学复杂性,目前缺乏针对LLMs幻觉的基准测试。因此,现有的基准测试不充分反映阿拉伯语的语言特征、文化特征和推理特征。为弥合这一差距,我们引入HalluScore,一个结构化的阿拉伯语问答基准,旨在评估LLMs在不同推理难度水平、各种知识领域、历史时间线和文化背景阿拉伯语情景下的幻觉行为。该基准包含827个精心挑选的问答题,用于评估、检测和缓解LLMs的幻觉。数据集通过结构化管道构建,包括质量保证、针对清晰性和事实有效性的过滤,以及基于模型的选择以保留持续引发幻觉的问题。每个问题都链接到验证的事实依据、答案解释和多标签标注。使用HalluScore基准,我们对17个阿拉伯语、多语言和推理LLMs的幻觉模式进行了全面实证分析。此外,我们提供了高质量的人类标注,识别所有评估LLMs的幻觉、非幻觉和部分幻觉响应。这些结果表明,阿拉伯语LLMs的幻觉超越了事实性错误,涉及文化理解、语言推理和逻辑一致性等挑战。我们发布HalluScore以支持未来研究,提高LLMs在阿拉伯语中的可靠性和文化能力。
引用
@article{arxiv.2605.17007,
title = {HalluScore: Large Language Model Hallucination Question Answering Benchmark},
author = {Aisha Alansari and Hamzah Luqman},
journal= {arXiv preprint arXiv:2605.17007},
year = {2026}
}