基于扩散分类器驱动的离线偏好型强化学习奖励
机器学习
2025-09-25 v3
摘要
离线偏好型强化学习(PbRL)通过偏好驱动的奖励反馈来减缓对奖励定义的需求,实现人类偏好与环境交互。然而,轨迹级偏好标签难以精确学习步级奖励,从而影响下游算法的性能。为缓解轨迹级偏好导致的步级奖励不足问题,本文提出一种新颖的偏好型奖励获取方法:扩散偏好型奖励(DPR)。DPR直接将步级偏好型奖励获取视为二分类问题,利用扩散分类器的鲁棒性来推断步级奖励。此外,为进一步利用轨迹级偏好信息,我们提出条件扩散偏好型奖励(C-DPR),在条件化轨迹级偏好标签以增强奖励推断。我们将上述方法应用于现有的离线强化学习算法,经过一系列实验结果表明,扩散分类器驱动的奖励优于基于Bradley-Terry模型的先前奖励获取方法。
引用
@article{arxiv.2503.01143,
title = {Diffusion Classifier-Driven Reward for Offline Preference-based Reinforcement Learning},
author = {Teng Pang and Bingzheng Wang and Guoqiang Wu and Yilong Yin},
journal= {arXiv preprint arXiv:2503.01143},
year = {2025}
}