PerHalluEval:面向波斯语的幻觉评估基准
计算与语言
2025-09-26 v1
摘要
幻觉是影响所有大型语言模型(LLM)的持续性问题,尤其是在波斯语等低资源语言中。PerHalluEval(波斯语幻觉评估)是首个针对波斯语量身定制的动态幻觉评估基准。我们的基准利用三阶段 LLM 驱动的管道,结合人工验证,生成关于 QA 和摘要任务的合理答案和摘要,重点检测外源性和内源性幻觉。此外,我们使用生成标记的对数概率来选择最可信的幻觉实例。在此,我们邀请人工标注员突出显示波斯语特定语境中的 QA 数据集,以评估 LLM 在波斯语文化相关内容方面的表现。我们评估了 12 个 LLM(包括开源和闭源模型)的 PerHalluEval 表现,发现这些模型在检测幻觉波斯文本方面普遍困难。我们表明,为摘要任务提供外部知识(即原始文档)可部分缓解幻觉问题。进一步地,针对专为波斯语训练的 LLM 与其他模型在幻觉方面没有显著差异。
引用
@article{arxiv.2509.21104,
title = {PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models},
author = {Mohammad Hosseini and Kimia Hosseini and Shayan Bali and Zahra Zanjani and Saeedeh Momtazi},
journal= {arXiv preprint arXiv:2509.21104},
year = {2025}
}