中文

基于反向模型想象的无模型离线强化学习

机器学习 2021-11-16 v2 人工智能

摘要

在离线强化学习(offline RL)中,主要挑战之一是如何处理学习策略与给定数据集之间的分布偏移。为解决此问题,近期的离线 RL 方法尝试引入保守偏置以鼓励在高置信区域中学习。无模型方法直接使用保守正则化或特殊网络结构将此类偏置编码到策略或价值函数学习中,但其受约束的策略搜索限制了在离线数据集之外的泛化能力。基于模型的方法学习带有保守量化的前向动力学模型,然后生成想象轨迹以扩展离线数据集。然而,由于离线数据集中样本有限,保守量化在支持区域外常常遭受过度泛化。不可靠的保守度量会误导前向基于模型的想象进入非期望区域,导致过度激进行为。为鼓励更强的保守性,我们提出了一种新颖的基于模型的离线 RL 框架,称为反向离线基于模型的想象(ROMI)。我们学习一个反向动力学模型以及一种新颖的反向策略,其能够生成导向离线数据集中目标目标状态的滚动轨迹。这些反向想象为无模型策略学习提供了有信息的数据增强,并实现了在离线数据集之外的保守泛化。ROMI 可有效结合现成的无模型算法,以在适当保守性下实现基于模型的泛化。实验结果表明,我们的方法能生成更保守的行为,并在离线 RL 基准任务上达到最先进的性能。

关键词

引用

@article{arxiv.2110.00188,
  title  = {Offline Reinforcement Learning with Reverse Model-based Imagination},
  author = {Jianhao Wang and Wenzhe Li and Haozhe Jiang and Guangxiang Zhu and Siyuan Li and Chongjie Zhang},
  journal= {arXiv preprint arXiv:2110.00188},
  year   = {2021}
}