中文

RewardsOfSum:探索用于摘要生成的强化学习奖励

计算与语言 2021-06-09 v1

摘要

迄今为止,大多数抽取式摘要模型都依赖负对数似然(NLL)的变体作为训练目标。在某些情况下,已加入强化学习以训练模型,使其目标更贴近评价指标(如 ROUGE)。然而,强化学习方法中所用奖励函数对性能起关键作用,且仍未被充分探索。为此,本文针对摘要生成任务提出两种奖励函数:第一个函数称为 RwB-Hinge,动态选择用于梯度更新的样本;第二个函数昵称为 RISK,利用一小池强候选来告知奖励。实验中,我们通过在一个规模和性质多样、包含九个摘要数据集上微调 NLL 预训练模型来检验所提方法。实验结果显示相对于负对数似然基线有一致提升。

关键词

引用

@article{arxiv.2106.04080,
  title  = {RewardsOfSum: Exploring Reinforcement Learning Rewards for Summarisation},
  author = {Jacob Parnell and Inigo Jauregi Unanue and Massimo Piccardi},
  journal= {arXiv preprint arXiv:2106.04080},
  year   = {2021}
}

备注

5th Workshop on Structured Prediction for NLP; held in conjunction with ACL-IJCNLP 2021