在强化学习中融合奖励与偏好
机器学习
2025-08-18 v1
摘要
我们提出了双反馈演员 (DFA),这是一种融合单个奖励和两两偏好(如有可用)的强化学习算法。DFA 直接使用策略的对数概率来建模偏好概率,避免了单独的奖励建模步骤。偏好可以由人类标注员提供(在状态级或轨迹级),也可以从存储在离线回放缓冲区中存储的 Q 值在线合成。基于布拉德-蒂里模型,我们证明了最小化 DFA 的偏好损失可恢复熵正则化的 Soft Actor-Critic (SAC) 策略。我们的仿真结果表明,DFA 在六个控制环境中训练的生成偏好模型式 SAC 性能相当或更好,并显示更稳定的训练过程。在布拉德-蒂里模型下的半合成偏好数据集上,DFA 在随机网格世界中超过了基于奖励模型的强化学习人类反馈 (RLHF) 基线,接近拥有真实奖励的 oracle 性能。
引用
@article{arxiv.2508.11363,
title = {Fusing Rewards and Preferences in Reinforcement Learning},
author = {Sadegh Khorasani and Saber Salehkaleybar and Negar Kiyavash and Matthias Grossglauser},
journal= {arXiv preprint arXiv:2508.11363},
year = {2025}
}