中文

面向离线强化学习的状态感知近端悲观算法

机器学习 2022-11-29 v1 人工智能

摘要

悲观性在离线强化学习(RL)中至关重要。一类广泛的离线RL算法通过显式或隐式的行为正则化来实现悲观性。然而,它们大多仅将策略差异视为行为正则化,忽略了离线状态分布与学习策略状态分布之间差异的影响,这可能导致对某些状态悲观不足,而对另一些状态悲观过度。考虑到这一问题,我们提出了一个名为状态感知近端悲观(State-Aware Proximal Pessimism, SA-PP)的原则性离线RL算法框架。SA-PP的核心思想是利用学习策略与离线数据集之间的折扣稳态状态分布比,以逐状态的方式调节行为正则化的程度,从而以更恰当的方式实现悲观性。我们首先从理论上证明了SA-PP相较于先前算法的优越性,表明SA-PP在广泛的设置下能产生更低的次优性上界。此外,我们基于代表性的CQL算法,借助DualDICE估计折扣稳态状态分布比,构建了SA-PP,并由此提出了一个名为状态感知保守Q学习(State-Aware Conservative Q-Learning, SA-CQL)的新算法。在标准离线RL基准上的大量实验表明,SA-CQL在大部分基准上优于流行的基线方法,并获得了最高的平均回报。

关键词

引用

@article{arxiv.2211.15065,
  title  = {State-Aware Proximal Pessimistic Algorithms for Offline Reinforcement Learning},
  author = {Chen Chen and Hongyao Tang and Yi Ma and Chao Wang and Qianli Shen and Dong Li and Jianye Hao},
  journal= {arXiv preprint arXiv:2211.15065},
  year   = {2022}
}