面向多奖励强化学习的动态方差自适应优势优化
计算与语言
2026-05-26 v1 机器学习
摘要
强化学习已成为对齐大型语言模型与人类意图及任务要求的标准范式。虽然群体相对策略优化提供了一种高效且无价值模型的方法,Proximal Policy Optimization的替代方案,但在现实世界的多奖励设置中仍面临挑战。标准的标量化做法,如奖励组合与优势组合,均存在显著缺陷:奖励组合常生成平方幅度过大的优势,导致训练不稳定;优势组合依赖静态超参数且忽视目标间的交叉相关性。为此,我们提出了动态方差自适应优势优化(DVAO),其动态调整组合权重基于滚动组内每个目标的经验奖励方差,有效地对学习信号较强的目标进行加权,同时抑制噪声较大的目标。我们数学证明了DVAO在保持优势幅度有界以实现稳定训练方面的优势,并引入自适应的跨目标正则化机制。广泛的在数学推理和工具使用基准测试中使用Qwen3和Qwen2.5模型进行实验,表明DVAO显著优于基线方法,实现了优越的多目标帕累托前沿和稳健的训练稳定性。
引用
@article{arxiv.2605.25604,
title = {DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning},
author = {Guochao Jiang and Jingyi Song and Guofeng Quan and Chuzhan Hao and Guohua Liu and Yuewei Zhang},
journal= {arXiv preprint arXiv:2605.25604},
year = {2026}
}