中文

具有通用函数逼近与单策略可集中性的可证明高效离线目标条件强化学习

机器学习 2023-10-13 v2 人工智能

摘要

目标条件强化学习 (GCRL) 指学习旨在到达多样目标的通用途技能。特别地,离线 GCRL 仅需要纯预收集数据集来执行训练任务,无需与环境额外交互。尽管离线 GCRL 已日益普及且许多先前工作已展示其经验成功,但对高效离线 GCRL 算法的理论理解尚不完善,尤其在状态空间巨大且离线数据集仅覆盖我们旨在学习的策略时。本文对一种已有的经验成功的离线 GCRL 算法提供严格的理论分析。我们证明,在稍作修改后,得益于目标函数的(半)强凸性,该算法在通用函数逼近下享有 O~(poly(1/ϵ))\widetilde{O}(\text{poly}(1/\epsilon)) 的样本复杂度(其中 ϵ\epsilon 为所学策略的期望次优性)。我们仅需要对数据集(单策略可集中性)与函数类(可实现性)的近乎最小假设。此外,该算法由两个未交织的优化步骤组成,我们称之为 VV-学习与策略学习,并且由于不涉及极小极大优化,在计算上稳定。我们还通过展示修改后的算法在各种真实环境中优于先前算法来经验验证我们的理论。据我们所知,这是首个在通用函数逼近与单策略可集中性下可证明高效,且无需求解极小极大优化问题即取得经验成功的算法。

关键词

引用

@article{arxiv.2302.03770,
  title  = {Provably Efficient Offline Goal-Conditioned Reinforcement Learning with General Function Approximation and Single-Policy Concentrability},
  author = {Hanlin Zhu and Amy Zhang},
  journal= {arXiv preprint arXiv:2302.03770},
  year   = {2023}
}

备注

NeurIPS 2023, 22 pages