面向基于偏好的离线强化学习的对抗策略优化
机器学习
2025-06-04 v2 人工智能
摘要
本文研究基于偏好的离线强化学习,其中学习基于预先收集的关于轨迹对的偏好反馈。尽管离线 PbRL 已展现出显著的经验成功,现有理论方法在确保不确定性下的保守性方面面临挑战,需要计算上难以处理的置信集构造。我们通过提出对抗偏好策略优化来解决这一局限性,这是一种用于离线 PbRL 的计算高效算法,无需依赖显式置信集即可保证样本复杂度界限。通过将 PbRL 构造为策略与模型之间的二人博弈,我们的方法以易于处理的方式强制实现了保守性。利用关于函数逼近和有界轨迹集中性的标准假设,我们推导出了样本复杂度界限。据我们所知,APPO 是首个同时具备统计效率和实际适用性的离线 PbRL 算法。在连续控制任务上的实验结果表明,APPO 能够有效地从复杂数据集中学习,表现出与现有 SOTA 方法相当的性能。
引用
@article{arxiv.2503.05306,
title = {Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning},
author = {Hyungkyu Kang and Min-hwan Oh},
journal= {arXiv preprint arXiv:2503.05306},
year = {2025}
}