强化学习替代监督:基于深度强化学习的查询聚焦摘要
计算与语言
2023-11-30 v1 人工智能
摘要
查询聚焦摘要(QfS)研究基于查询从文档中生成摘要的系统。受如下洞见启发:强化学习(RL)为自然语言生成中的监督学习(SL)提供了泛化,从而在经验上优于SL,我们对该QfS任务采用基于RL的方法。此外,我们还解决了在带有Teacher Forcing的Transformers中运用RL的冲突。我们开发了多个策略梯度网络,以ROUGE、BLEU和语义相似度为多种奖励信号进行训练,在基准数据集(ELI5)的ROUGE-L指标上取得比最先进方法高10分的改进。我们还展示了我们的方法在另一基准数据集(DebatePedia)零样本设定下的表现——我们的方法取得了与专门在DebatePedia上训练的基线相当的结果。为辅助RL训练,我们提出了一种更好的语义相似度奖励,由基于聚类假设开发的新型段落嵌入方案实现。最后,我们贡献了一个黄金标准测试数据集以推动QfS与长形式问答(LfQA)的进一步研究。
引用
@article{arxiv.2311.17514,
title = {Reinforcement Replaces Supervision: Query focused Summarization using Deep Reinforcement Learning},
author = {Swaroop Nath and Harshad Khadilkar and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:2311.17514},
year = {2023}
}