RewardsOfSum:探索用于摘要生成的强化学习奖励
计算与语言
2021-06-09 v1
摘要
迄今为止,大多数抽取式摘要模型都依赖负对数似然(NLL)的变体作为训练目标。在某些情况下,已加入强化学习以训练模型,使其目标更贴近评价指标(如 ROUGE)。然而,强化学习方法中所用奖励函数对性能起关键作用,且仍未被充分探索。为此,本文针对摘要生成任务提出两种奖励函数:第一个函数称为 RwB-Hinge,动态选择用于梯度更新的样本;第二个函数昵称为 RISK,利用一小池强候选来告知奖励。实验中,我们通过在一个规模和性质多样、包含九个摘要数据集上微调 NLL 预训练模型来检验所提方法。实验结果显示相对于负对数似然基线有一致提升。
引用
@article{arxiv.2106.04080,
title = {RewardsOfSum: Exploring Reinforcement Learning Rewards for Summarisation},
author = {Jacob Parnell and Inigo Jauregi Unanue and Massimo Piccardi},
journal= {arXiv preprint arXiv:2106.04080},
year = {2021}
}
备注
5th Workshop on Structured Prediction for NLP; held in conjunction with ACL-IJCNLP 2021