中文

从单文档到多文档:LLM在多文档摘要中的幻觉现象

计算与语言 2025-04-29 v2

摘要

虽然许多研究旨在减少大型语言模型(LLM)在单文档任务中的幻觉现象,但关于LLM在多文档摘要(MDS)任务中幻觉的研究仍然有限。具体来说,尚不清楚处理多个文档(例如重复和信息多样性)带来的挑战如何影响模型输出。在本研究中,我们调查了LLM在对来自多个文档的特定主题信息进行摘要时,幻觉如何表现。由于目前没有针对MDS幻觉研究的基准数据集,我们使用现有的新闻和对话数据集,标注了特定主题见解,以创建两个新的多文档基准。我们对5个LLM在这些基准上的表现进行评估,发现平均情况下,LLM生成的摘要内容中最高达75%为幻觉内容,幻觉更倾向于发生在摘要的后半部分。此外,当对不存在的特定主题相关信息进行摘要时,gpt-3.5-turbo和GPT-4o仍分别会生成约79.35%和44%的摘要,这凸显了其捏造内容的倾向。为理解这些幻觉的特征,我们对700多个见解进行了人工评估,发现大多数错误源于未遵循指令或产生过于泛泛的见解。受此启发,我们研究了简单后验基准在缓解幻觉方面的效果,但发现其仅 moderately effective。我们的研究结果凸显了需要更有效的方法来系统性地缓解MDS中的幻觉的必要性。我们将公开发布的数据集和代码于github.com/megagonlabs/Hallucination_MDS。

关键词

引用

@article{arxiv.2410.13961,
  title  = {From Single to Multi: How LLMs Hallucinate in Multi-Document Summarization},
  author = {Catarina G. Belem and Pouya Pezeshkpour and Hayate Iso and Seiji Maekawa and Nikita Bhutani and Estevam Hruschka},
  journal= {arXiv preprint arXiv:2410.13961},
  year   = {2025}
}

备注

NAACL 2025 - Findings