中文

当数据几何遇见深度函数:离线强化学习的泛化

机器学习 2023-03-02 v3 人工智能 机器人学

摘要

在离线强化学习(RL)中,对策略学习有害的一个问题是深度Q函数在分布外(OOD)区域的误差累积。遗憾的是,现有的离线RL方法往往过于保守,不可避免地损害了在数据分布之外的泛化性能。在我们的研究中,一个有趣的观察是深度Q函数在训练数据的凸包内部近似良好。受此启发,我们提出了一种新方法DOGE(Distance-sensitive Offline RL with better GEneralization,距离敏感且具有更好泛化性的离线RL)。DOGE将数据集几何与深度函数逼近器结合于离线RL中,并能够在可泛化的OOD区域中进行利用,而非严格将策略约束在数据分布内。具体而言,DOGE训练一个状态条件距离函数,可作为一个策略约束轻松插入标准actor-critic方法中。我们的算法简单而优雅,在D4RL基准上相比最先进的方法具有更好的泛化性。理论分析表明了我们的方法相对于仅基于数据分布或支撑约束的现有方法的优越性。

关键词

引用

@article{arxiv.2205.11027,
  title  = {When Data Geometry Meets Deep Function: Generalizing Offline Reinforcement Learning},
  author = {Jianxiong Li and Xianyuan Zhan and Haoran Xu and Xiangyu Zhu and Jingjing Liu and Ya-Qin Zhang},
  journal= {arXiv preprint arXiv:2205.11027},
  year   = {2023}
}

备注

ICLR2023