中文

面向 RELAXed 多文档摘要的多文档覆盖奖励

计算与语言 2022-03-08 v1

摘要

多文档摘要(MDS)近年来取得了显著进展,部分得益于新的专用数据集和大容量语言模型的出现。然而,这些模型一个长期存在的局限是它们针对有限的参考摘要进行训练,并采用朴素的最大似然目标。与许多其他生成任务一样,强化学习(RL)有潜力改进 MDS 模型的训练;然而,它需要一个精心设计的奖励,以确保对参考摘要和输入文档的恰当利用。为此,本文提出使用一种奖励对 MDS 基线进行微调,该奖励在基于参考的度量(如 ROUGE)与输入文档的覆盖率之间进行平衡。为实现该方法,我们利用 RELAX(Grathwohl 等人,2018),一种兼具低方差和无偏性的现代梯度估计器,并以少样本方式对基线进行微调,以保证稳定性和计算效率。在 Multi-News 和 WCEP MDS 数据集上的实验结果表明,相较基线,平均 ROUGE 分数提升高达 +0.95 个百分点,METEOR 分数提升高达 +3.17 个百分点,并与已有文献结果具有竞争力。此外,结果表明输入文档的覆盖率得到提升,且在所有文档间分布均匀。

关键词

引用

@article{arxiv.2203.02894,
  title  = {A Multi-Document Coverage Reward for RELAXed Multi-Document Summarization},
  author = {Jacob Parnell and Inigo Jauregi Unanue and Massimo Piccardi},
  journal= {arXiv preprint arXiv:2203.02894},
  year   = {2022}
}

备注

Accepted to ACL 2022