面向离线强化学习的置信度条件化值函数
机器学习
2023-10-31 v2 人工智能
摘要
离线强化学习(RL)有望仅利用已有的静态数据集学习有效策略,而无需任何代价高昂的在线交互。为此,离线 RL 方法必须处理数据集与所学策略之间的分布偏移。最常见的方法是学习保守的或下界的值函数,其低估分布外(OOD)动作的回报。然而,此类方法存在一个显著缺陷:在此类值函数上优化的策略只能依照固定的、可能次优的保守程度行事。但若我们能在训练时学习对应于不同保守程度的策略,并设计一种在评估时动态选取其中之一的方法,则可缓解该问题。为此,本文提出学习额外以保守程度为条件的值函数,我们称之为置信度条件化值函数。我们推导了一种新的 Bellman 备份形式,其以高概率同时学习任意置信度下的 Q 值。通过以置信度为条件,我们的价值函数可借助迄今观测历史控制置信水平,从而在在线评估中实现自适应策略。该方法在实践中可通过将现有保守算法的 Q 函数以置信度为条件来实现。我们从理论上证明,所学值函数在任意期望置信度下均产生真实值的保守估计。最后,我们经实验表明,本算法在多个离散控制领域优于现有保守离线 RL 算法。
引用
@article{arxiv.2212.04607,
title = {Confidence-Conditioned Value Functions for Offline Reinforcement Learning},
author = {Joey Hong and Aviral Kumar and Sergey Levine},
journal= {arXiv preprint arXiv:2212.04607},
year = {2023}
}
备注
published as a paper in ICLR 2023; 16 pages