中文

摘要—源文本命题级对齐:任务、数据集与有监督基线

计算与语言 2021-09-27 v2

摘要

将参考摘要中的句子与其源文档中的对应句进行对齐,已被证明是一项有用的辅助摘要任务,特别是在为显著性检测生成训练数据方面。尽管其实用性已得到评估,对齐步骤大多采用启发式无监督方法(通常为基于 ROUGE 的方法),且从未被独立优化或评估。本文提出将摘要—源文本对齐确立为一项显式任务,同时引入两项主要创新:(1) 在更精确的命题跨度级别上应用该任务;(2) 将其作为有监督分类任务来处理。为此,我们基于已有的摘要评估数据自动构建了一个用于命题级对齐的新训练数据集。此外,我们通过众包开发了开发集与测试集,以支持模型开发与恰当评估。利用这些数据,我们提出了一个有监督的命题对齐基线模型,显示出比无监督方法更优的对齐质量。

关键词

引用

@article{arxiv.2009.00590,
  title  = {Summary-Source Proposition-level Alignment: Task, Datasets and Supervised Baseline},
  author = {Ori Ernst and Ori Shapira and Ramakanth Pasunuru and Michael Lepioshkin and Jacob Goldberger and Mohit Bansal and Ido Dagan},
  journal= {arXiv preprint arXiv:2009.00590},
  year   = {2021}
}

备注

CoNLL 2021