接纳分歧以获取更丰富洞见:一个多文档摘要基准及从新闻文章中总结多样化信息的案例研究
计算与语言
2024-03-26 v2
摘要
以往关于多文档新闻摘要的研究通常集中于整理所有来源一致的信息。然而,对关于同一事件的、分散在多篇报道中的多样化信息进行摘要仍鲜有探索。本文提出一项新任务,即对涵盖同一事件的多篇新闻文章中出现的多样化信息进行摘要。为推进该任务,我们设计了用于识别多样化信息的数据收集框架,并构建了一个名为 DiverseSumm 的数据集。该数据集包含 245 个新闻事件,每个事件由 10 篇新闻文章组成,并配有人工校验的参考摘要。接下来,为实现一致的自动评测,我们开展了全面分析,以定位在利用基于大语言模型(Large Language Model, LLM)的指标评估摘要覆盖度与忠实度时存在的位置和冗长度偏差。通过相关性分析,我们阐明了在 DiverseSumm 数据集上有效使用基于 LLM 的自动指标的最佳实践。最后,我们通过分析 LLM 能够识别哪类多样化信息,研究了 LLM 如何对多篇新闻文章进行摘要。我们的分析表明,尽管 LLM 在单文档摘要方面能力卓越,所提出的任务对其而言仍是一项复杂挑战,主要因其覆盖有限,GPT-4 平均仅能覆盖不到 40% 的多样化信息。
引用
@article{arxiv.2309.09369,
title = {Embrace Divergence for Richer Insights: A Multi-document Summarization Benchmark and a Case Study on Summarizing Diverse Information from News Articles},
author = {Kung-Hsiang Huang and Philippe Laban and Alexander R. Fabbri and Prafulla Kumar Choubey and Shafiq Joty and Caiming Xiong and Chien-Sheng Wu},
journal= {arXiv preprint arXiv:2309.09369},
year = {2024}
}
备注
NAACL 2024