中文

CADS:关于抽象对话摘要挑战的系统文献综述

计算与语言 2025-04-25 v3 人工智能

摘要

抽象对话摘要是将对话提炼为信息丰富且简洁摘要的任务。尽管已有关于此主题的综述,但缺乏对话摘要挑战的全面性工作,缺乏统一对该任务理解的工作,以及缺乏将所提出技术、数据集和评估指标与挑战对齐的工作。本文系统性地综述了 2019 年至 2024 年间发表的 1262 篇独立研究论文,基于 Semantic Scholar 和 DBLP 数据库。我们涵盖了对话摘要中存在的主要挑战(即语言、结构、理解、说话人、显著性和事实性),并将其与相应技术(如图基方法、额外训练任务和规划策略)相关联,这些技术通常过度依赖于基于 BART 的编码器-解码器模型。我们发现,尽管某些挑战(如语言)由于训练方法取得了显著进展,主要归功于训练方法,但其他挑战(如理解、事实性和显著性)仍然困难且存在显著的研究机会。我们调查了这些方法的评估方式,涵盖了对话子领域(如会议、医疗)的数据集、 established 自动评估指标和人类评估方法。我们注意到,只有少数数据集横跨所有子领域。ROUGE 指标使用最频繁,而人类评估经常在对内部标注者一致性和标注指南方面不足。此外,我们讨论了最近探索的大型语言模型的可能影响,并指出尽管其相关性和难度可能发生变化,我们描述的挑战分类学仍然具有相关性。

关键词

引用

@article{arxiv.2406.07494,
  title  = {CADS: A Systematic Literature Review on the Challenges of Abstractive Dialogue Summarization},
  author = {Frederic Kirstein and Jan Philip Wahle and Bela Gipp and Terry Ruas},
  journal= {arXiv preprint arXiv:2406.07494},
  year   = {2025}
}

备注

Published in the Journal of Artificial Intelligence Research (JAIR) (https://www.jair.org/index.php/jair/article/view/16674)