双时间尺度 Actor-Critic 方法的有限时间分析
机器学习
2022-10-11 v3 最优化与控制
机器学习
摘要
与其他强化学习算法相比,Actor-Critic(AC)方法已展现出极大的经验成功,其中 actor 使用策略梯度改进学习策略,critic 使用时序差分学习估计策略梯度。在双时间尺度学习率调度下,AC 的渐近收敛性已在文献中被充分研究。然而,actor-critic 方法的非渐近收敛与有限样本复杂度在很大程度上仍是开放问题。本工作中,我们在非独立同分布设定下为双时间尺度 actor-critic 方法提供非渐近分析。我们证明 actor-critic 方法保证能以 的样本复杂度找到非凹性能函数 的一阶平稳点(即 )。据我们所知,这是首个为双时间尺度 actor-critic 方法提供有限时间分析与样本复杂度界的工作。
引用
@article{arxiv.2005.01350,
title = {A Finite Time Analysis of Two Time-Scale Actor Critic Methods},
author = {Yue Wu and Weitong Zhang and Pan Xu and Quanquan Gu},
journal= {arXiv preprint arXiv:2005.01350},
year = {2022}
}
备注
39 pages. In NeurIPS 2020