中文

双重稳健离屏 Actor-Critic:收敛性与最优性

机器学习 2021-07-20 v4 机器学习

摘要

设计离屏强化学习算法通常是一项极具挑战性的任务,因为期望的迭代更新往往涉及对屏上分布的期望。先前的离屏 actor-critic(AC)算法引入了新的评论者,利用密度比来调整分布失配以稳定收敛,但代价是由于密度比和值函数的估计误差可能引入高偏差。在本文中,我们针对折扣 MDP 开发了双重稳健离屏 AC(DR-Off-PAC),其可利用学习的干扰函数以减少估计误差。此外,DR-Off-PAC 采用单时间尺度结构,其中 actor 和评论者以恒定步长同时更新,因此比采用双时间尺度或嵌套循环结构的先前算法更具样本效率。我们研究了有限时间收敛速率,并刻画了 DR-Off-PAC 达到 ϵ\epsilon-精确最优策略的样本复杂度。我们还表明,DR-Off-PAC 的整体收敛对仅依赖于逼近函数表达能力的近似误差具有双重稳健性。据我们所知,我们的研究建立了首个针对单时间尺度离屏 AC 算法的整体样本复杂度分析。

关键词

引用

@article{arxiv.2102.11866,
  title  = {Doubly Robust Off-Policy Actor-Critic: Convergence and Optimality},
  author = {Tengyu Xu and Zhuoran Yang and Zhaoran Wang and Yingbin Liang},
  journal= {arXiv preprint arXiv:2102.11866},
  year   = {2021}
}

备注

Published in ICML 2021