中文

多目标强化学习中的奖励平衡:基于超体积优化的文本摘要

计算与语言 2025-10-23 v1 人工智能

摘要

文本摘要是需要同时优化多个目标的关键任务, 包括一致性、连贯性、相关性和流畅性, 这给带来了巨大挑战. 虽然大型语言模型 (LLM) 由于强化学习 (RL) 在增强方面显示出卓越性能, 但鲜有研究聚焦于基于 LLM 的 RL 优化摘要的多目标问题. 本文引入超体积优化 (HVO), 一种新型优化策略, 通过使用超体积方法在奖励过程中动态调整不同组之间的得分. 该方法引导模型的优化逐渐逼近帕累托前沿, 从而在多个目标上生成平衡摘要. 实验结果表明, 我们的方法在整体得分方面优于组相对策略优化 (GRPO), 在不同维度上表现更平衡. 此外, 经 HVO 提升的 7B 基础模型在摘要任务中可与 GPT-4 相当, 且保持更短的生成长度.我们的代码已公开于 https://github.com/ai4business-LiAuto/HVO.git

关键词

引用

@article{arxiv.2510.19325,
  title  = {Balancing Rewards in Text Summarization: Multi-Objective Reinforcement Learning via HyperVolume Optimization},
  author = {Junjie Song and Yiwen Liu and Dapeng Li and Yin Sun and Shukun Fu and Siqi Chen and Yuji Cao},
  journal= {arXiv preprint arXiv:2510.19325},
  year   = {2025}
}