中文

具有可实现性与单策略集中性的离线强化学习

机器学习 2022-06-29 v3 机器学习

摘要

离线强化学习(RL)的样本效率保证通常依赖于对函数类(例如 Bellman 完备性)和数据覆盖(例如全策略集中性)的强假设。尽管近期在放松这些假设方面做出了努力,但现有工作仅能放松两者之一,而对另一因素的强假设保持不变。作为一个重要的开放问题,我们能否在两个因素均具有弱假设的情况下实现样本高效的离线 RL?在本文中,我们对这个问题给出了肯定的回答。我们分析了一个基于 MDPs 原始-对偶公式的简单算法,其中对偶变量(折扣占用)使用针对离线数据的密度比函数进行建模。通过适当的正则化,我们证明该算法仅在实际可实现性和单策略集中性下即具有多项式样本复杂度。我们还提供了基于不同假设的替代分析,以阐明离线 RL 原始-对偶算法的本质。

关键词

引用

@article{arxiv.2202.04634,
  title  = {Offline Reinforcement Learning with Realizability and Single-policy Concentrability},
  author = {Wenhao Zhan and Baihe Huang and Audrey Huang and Nan Jiang and Jason D. Lee},
  journal= {arXiv preprint arXiv:2202.04634},
  year   = {2022}
}