中文

SNaC:面向叙事摘要的连贯性错误检测

计算与语言 2022-10-31 v2

摘要

长文本摘要的进展受到缺乏适当评估框架的制约。当必须生成长篇摘要以恰当覆盖文本的各个方面时,该摘要需要呈现连贯的叙事以便读者理解,但当前的自动与人工评估方法均无法识别连贯性上的缺失。在本工作中,我们提出 SNaC,一种基于细粒度标注的长摘要叙事连贯性评估框架。我们构建了生成式叙事摘要中连贯性错误的分类体系,并针对 150 篇书籍与电影剧本摘要中的 6.6k 个句子收集了跨度级标注。我们的工作首次刻画了最先进摘要模型所产生的连贯性错误,并给出了从众包标注者处获取连贯性判断的协议。此外,我们表明所收集的标注可用于训练一个强大的分类器,以自动定位生成摘要中的连贯性错误,并对既往连贯性建模工作进行基准评测。最后,我们的 SNaC 框架可支持长文档摘要与连贯性评估的未来工作,包括改进的摘要建模与事后摘要修正。

关键词

引用

@article{arxiv.2205.09641,
  title  = {SNaC: Coherence Error Detection for Narrative Summarization},
  author = {Tanya Goyal and Junyi Jessy Li and Greg Durrett},
  journal= {arXiv preprint arXiv:2205.09641},
  year   = {2022}
}

备注

EMNLP 2022