更好的奖励带来更好的摘要:无参考摘要学习
计算与语言
2019-09-04 v1
摘要
基于强化学习(RL)的文档摘要系统在 ROUGE 分数上取得了最先进的性能,因为它们在训练期间直接使用 ROUGE 作为奖励。然而,具有高 ROUGE 分数的摘要往往得到较低的人类评价。为寻找能引导 RL 生成受人类青睐摘要的更好奖励函数,我们从 2,500 篇摘要上的人类评分中学习了一个奖励函数。我们的奖励函数仅以文档和系统摘要作为输入。因此,一旦训练完成,它便可用于训练基于 RL 的摘要系统而无需使用任何参考摘要。我们表明,我们学习的奖励与人工评分的相关性显著高于以往方法。人类评估实验表明,相较于最先进的监督学习系统和以 ROUGE 为奖励的 RL 摘要系统,在训练中使用我们学习的奖励的 RL 系统生成了具有更高人类评分的摘要。所学习的奖励函数和我们的源代码可在 https://github.com/yg211/summary-reward-no-reference 获取。
引用
@article{arxiv.1909.01214,
title = {Better Rewards Yield Better Summaries: Learning to Summarise Without References},
author = {Florian Böhm and Yang Gao and Christian M. Meyer and Ori Shapira and Ido Dagan and Iryna Gurevych},
journal= {arXiv preprint arXiv:1909.01214},
year = {2019}
}
备注
Accepted to EMNLP2019