两种时间尺度(自然)行动者-评论者算法的非渐近收敛分析
机器学习
2020-05-11 v2 机器学习
摘要
作为一类重要的强化学习算法,行动者-评论者(AC)和自然行动者-评论者(NAC)算法常通过两种方式执行以寻找最优策略。在第一种嵌套循环设计中,行动者对策略的一次更新之后是评论者对价值函数的整轮更新,此类 AC 和 NAC 算法的有限样本分析近来已得到较好建立。第二种两时间尺度设计,其中行动者与评论者同时更新但采用不同学习率,比嵌套循环设计调参少得多,因此显著更易实现。尽管文献中已证明两时间尺度 AC 和 NAC 收敛,但其有限样本收敛速率尚未建立。在本文中,我们首次给出了在马尔可夫采样下且行动者具有一般策略类逼近时两时间尺度 AC 和 NAC 的此类非渐近收敛速率。我们表明,两时间尺度 AC 需要总体样本复杂度为 的量级以达到 精度的驻点,而两时间尺度 NAC 需要总体样本复杂度为 的量级以达到 精度的全局最优点。我们发展了新颖技术,用于界定因动态变化的马尔可夫采样导致的行动者偏差误差,以及分析具有动态变化基函数和转移核的线性评论者的收敛速率。
引用
@article{arxiv.2005.03557,
title = {Non-asymptotic Convergence Analysis of Two Time-scale (Natural) Actor-Critic Algorithms},
author = {Tengyu Xu and Zhe Wang and Yingbin Liang},
journal= {arXiv preprint arXiv:2005.03557},
year = {2020}
}
备注
The results of this paper were initially submitted for publication in February 2020