中文

FFE-Hallu:固定比喻表达中的幻觉——波斯语中成语和谚语的基准

计算与语言 2026-01-29 v1

摘要

比喻语言,特别是固定比喻表达(FFE)如成语和谚语,仍然给大型语言模型(LLMs)带来持久的挑战。与字面短语不同,FFE是文化依赖性强、主要非组成性且传统上固定不变的,这使其特别容易受到比喻幻觉的威胁。我们定义比喻幻觉为生成或认可听起来符合比喻且合理但在目标语言中不存在的表达。我们引入FFEHallu,面向波斯语的第一个全面基准,用于评估比喻幻觉,波斯语是语言丰富且在学术研究中被低估的语言。FFEHallu包含600个精心挑选的实例,涵盖三个互补任务:(i) 从意义生成FFE,(ii) 检测四个受控构造类别中的虚构FFE,以及(iii) FFE到FFE的英语至波斯语翻译。在评估了六个最先进的多语言LLMs后,我们发现比喻能力和文化 grounding 存在系统性薄弱。虽然像GPT4.1这样的模型在拒绝虚构FFE和检索真实FFE方面表现相对较好,但大多数模型在可靠区分真实表达与高质量虚构表达方面仍感到困难,并且在跨语言翻译时经常发生幻觉。这些发现揭示了当前LLMs在处理比喻语言方面的重大差距,强调了针对评估和缓解比喻幻觉所需的针对性基准的重要性。

关键词

引用

@article{arxiv.2601.20105,
  title  = {FFE-Hallu:Hallucinations in Fixed Figurative Expressions:Benchmark of Idioms and Proverbs in the Persian Language},
  author = {Faezeh Hosseini and Mohammadali Yousefzadeh and Yadollah Yaghoobzadeh},
  journal= {arXiv preprint arXiv:2601.20105},
  year   = {2026}
}

备注

EACL 2026