OPRIDE:通过数据集内探索的离线偏好强化学习
机器学习
2026-04-06 v1 人工智能
摘要
偏好强化学习(PbRL)有助于避免复杂的奖励设计并更好地与人类意图对齐,在各种现实应用中展现出巨大前景。然而,获取人类偏好反馈可能代价高昂且耗时,这构成了PbRL的强有力障碍。在这项工作中,我们解决了离线PbRL中查询效率低下的问题,指出了两个主要原因:探索效率低下和学习奖励函数的过度优化。为应对这些挑战,我们提出了一种新算法——离线偏好强化学习通过数据集内探索(OPRIDE),旨在提高离线PbRL的查询效率。OPRIDE 包含两个关键特征:一种最大化查询信息量的原则性探索策略,以及一种旨在减轻学习奖励函数过度优化的折扣调度机制。通过实证评估,我们证明 OPRIDE 显著优于先前方法,以显著更少的查询实现了强劲性能。此外,我们提供了算法效率的理论保证。在各种运动、操作和导航任务上的实验结果强调了我们的方法的有效性和多功能性。
引用
@article{arxiv.2604.02349,
title = {OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration},
author = {Yiqin Yang and Hao Hu and Yihuan Mao and Jin Zhang and Chengjie Wu and Yuhua Jiang and Xu Yang and Runpeng Xie and Yi Fan and Bo Liu and Yang Gao and Bo Xu and Chongjie Zhang},
journal= {arXiv preprint arXiv:2604.02349},
year = {2026}
}