中文

PerHalluEval:面向波斯语的幻觉评估基准

计算与语言 2025-09-26 v1

摘要

幻觉是影响所有大型语言模型(LLM)的持续性问题,尤其是在波斯语等低资源语言中。PerHalluEval(波斯语幻觉评估)是首个针对波斯语量身定制的动态幻觉评估基准。我们的基准利用三阶段 LLM 驱动的管道,结合人工验证,生成关于 QA 和摘要任务的合理答案和摘要,重点检测外源性和内源性幻觉。此外,我们使用生成标记的对数概率来选择最可信的幻觉实例。在此,我们邀请人工标注员突出显示波斯语特定语境中的 QA 数据集,以评估 LLM 在波斯语文化相关内容方面的表现。我们评估了 12 个 LLM(包括开源和闭源模型)的 PerHalluEval 表现,发现这些模型在检测幻觉波斯文本方面普遍困难。我们表明,为摘要任务提供外部知识(即原始文档)可部分缓解幻觉问题。进一步地,针对专为波斯语训练的 LLM 与其他模型在幻觉方面没有显著差异。

关键词

引用

@article{arxiv.2509.21104,
  title  = {PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models},
  author = {Mohammad Hosseini and Kimia Hosseini and Shayan Bali and Zahra Zanjani and Saeedeh Momtazi},
  journal= {arXiv preprint arXiv:2509.21104},
  year   = {2025}
}