基于离线偏好型强化学习中的轨迹返回正则化
人工智能
2024-12-24 v2 机器学习
摘要
离线偏好型强化学习(PbRL)通常分为两个阶段:首先使用人类偏好学习奖励模型并为奖励自由的离线数据集标注奖励;其次通过离线RL优化学习到的奖励来学习策略。然而,从轨迹级偏好反馈准确建模步骤级奖励存在内在挑战。所引入的奖励偏差,特别是对预测奖励的过高估计,导致乐观的轨迹拼接,从而破坏离线RL阶段所必需的悲观性机制。为解决这一挑战,我们提出了一种用于离线PbRL的轨迹返回正则化(DTR),它利用条件序列建模来缓解在奖励偏差下学习不准确轨迹拼接的风险。具体而言,DTR采用决策转换器和TD学习,在保持高内数据集轨迹返回的忠诚度与基于高奖励标签选择最优动作之间取得平衡。此外,我们引入一种集成归一化技术,有效地整合多个奖励模型,在奖励差异化和准确性之间实现权衡。在 various基准测试上的经验评估表明,DTR在其他多种SOTA基线之上具有优势。
引用
@article{arxiv.2412.09104,
title = {In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning},
author = {Songjun Tu and Jingbo Sun and Qichao Zhang and Yaocheng Zhang and Jia Liu and Ke Chen and Dongbin Zhao},
journal= {arXiv preprint arXiv:2412.09104},
year = {2024}
}
备注
20 pages, Proceedings of the 39th AAAI Conference on Artificial Intelligence (AAAI-25)