面向不确定性驱动的离线强化学习的悲观自助法
机器学习
2022-02-24 v1
摘要
离线强化学习(RL)旨在从先前收集的数据集中学习策略,而无需探索环境。直接将离策略算法应用于离线 RL 通常会因分布外(OOD)动作引起的外推误差而失败。先前的方法通过惩罚 OOD 动作的 Q 值或将训练策略约束为接近行为策略来解决此问题。然而,此类方法通常阻碍价值函数在离线数据之外的泛化,且缺乏对 OOD 数据的精确刻画。在本文中,我们提出用于离线 RL 的悲观自助法(PBRL),一种无显式策略约束的纯不确定性驱动离线算法。具体而言,PBRL 通过自助 Q 函数之间的不一致性进行不确定性量化,并基于估计的不确定性惩罚价值函数以执行悲观更新。为解决外推误差,我们进一步提出一种新颖的 OOD 采样方法。我们证明这种 OOD 采样与悲观自助法在线性 MDP 中可产生可证明的不确定性量化器,从而为 PBRL 提供理论依据。在 D4RL 基准上的大量实验表明,PBRL 相较于最先进算法具有更优性能。
引用
@article{arxiv.2202.11566,
title = {Pessimistic Bootstrapping for Uncertainty-Driven Offline Reinforcement Learning},
author = {Chenjia Bai and Lingxiao Wang and Zhuoran Yang and Zhihong Deng and Animesh Garg and Peng Liu and Zhaoran Wang},
journal= {arXiv preprint arXiv:2202.11566},
year = {2022}
}
备注
ICLR 2022