中文

离策略自然 Actor-Critic 算法的有限样本分析

机器学习 2021-06-14 v2 最优化与控制 机器学习

摘要

本文中,我们为基于重要性采样的自然 actor-critic(NAC)算法的离策略变体提供了有限样本收敛保证。具体地,我们表明在适当选择步长下,该算法以 O(ϵ3log2(1/ϵ))\mathcal{O}(\epsilon^{-3}\log^2(1/\epsilon)) 的样本复杂度收敛到全局最优策略。为克服重要性采样导致的大方差问题,我们针对 critic 提出 QQ-trace 算法,其受 V-trace 算法 \cite{espeholt2018impala} 启发。这使我们能显式控制偏差与方差,并刻画二者间的权衡。作为离策略采样的优势,我们结果的一个主要特征是除行为策略诱导的马尔可夫链的遍历性外,不需要任何额外假设。

关键词

引用

@article{arxiv.2102.09318,
  title  = {Finite-Sample Analysis of Off-Policy Natural Actor-Critic Algorithm},
  author = {Sajad Khodadadian and Zaiwei Chen and Siva Theja Maguluri},
  journal= {arXiv preprint arXiv:2102.09318},
  year   = {2021}
}