中文

更好的奖励带来更好的摘要:无参考摘要学习

计算与语言 2019-09-04 v1

摘要

基于强化学习(RL)的文档摘要系统在 ROUGE 分数上取得了最先进的性能,因为它们在训练期间直接使用 ROUGE 作为奖励。然而,具有高 ROUGE 分数的摘要往往得到较低的人类评价。为寻找能引导 RL 生成受人类青睐摘要的更好奖励函数,我们从 2,500 篇摘要上的人类评分中学习了一个奖励函数。我们的奖励函数仅以文档和系统摘要作为输入。因此,一旦训练完成,它便可用于训练基于 RL 的摘要系统而无需使用任何参考摘要。我们表明,我们学习的奖励与人工评分的相关性显著高于以往方法。人类评估实验表明,相较于最先进的监督学习系统和以 ROUGE 为奖励的 RL 摘要系统,在训练中使用我们学习的奖励的 RL 系统生成了具有更高人类评分的摘要。所学习的奖励函数和我们的源代码可在 https://github.com/yg211/summary-reward-no-reference 获取。

关键词

引用

@article{arxiv.1909.01214,
  title  = {Better Rewards Yield Better Summaries: Learning to Summarise Without References},
  author = {Florian Böhm and Yang Gao and Christian M. Meyer and Ori Shapira and Ido Dagan and Iryna Gurevych},
  journal= {arXiv preprint arXiv:1909.01214},
  year   = {2019}
}

备注

Accepted to EMNLP2019