基于强化学习的文本摘要多维度优化
计算与语言
2024-06-04 v1 人工智能
摘要
摘要质量的评估涵盖多个维度,例如一致性、连贯性、相关性和流畅性。然而,现有的摘要方法通常针对特定维度,在生成跨多个维度良好平衡的摘要方面面临挑战。在本文中,我们提出了多目标强化学习,专门用于生成在所有四个维度上都平衡的摘要。我们引入了两种自适应学习的多维度优化策略:1) MDO_min,奖励当前得分最低的维度;2) MDO_pro,类似于多任务学习优化多个维度,通过梯度投影解决跨维度的梯度冲突。与先前依赖参考摘要的基于ROUGE的奖励不同,我们使用一个与人类偏好一致的基于问答的奖励模型。此外,我们发现能够通过调整折扣因子来调节摘要的长度,寻求生成简洁但信息丰富、包含关键点的摘要。与代表性摘要数据集上的基线模型相比,我们的方法取得了显著的性能提升,尤其是在那些被忽视的维度上。
引用
@article{arxiv.2406.00303,
title = {Multi-Dimensional Optimization for Text Summarization via Reinforcement Learning},
author = {Sangwon Ryu and Heejin Do and Yunsu Kim and Gary Geunbae Lee and Jungseul Ok},
journal= {arXiv preprint arXiv:2406.00303},
year = {2024}
}
备注
ACL 2024