单时间尺度 actor-critic 可证明找到全局最优策略
机器学习
2021-06-15 v2 最优化与控制
机器学习
摘要
我们研究 actor-critic(最流行的强化学习算法族之一)的全局收敛性与全局最优性。虽然现有关于 actor-critic 的工作大多采用双层或双时间尺度更新,我们聚焦于更实用的单时间尺度设定,即 actor 与 critic 同时更新。具体而言,在每次迭代中,critic 更新通过仅应用一次 Bellman 评估算子获得,而 actor 使用由 critic 计算的策略梯度方向更新。此外,我们考虑两种函数逼近设定,其中 actor 与 critic 均由线性或深度神经网络表示。对于两种情况,我们均证明 actor 序列以次线性 速率收敛到全局最优策略,其中 为迭代次数。据我们所知,我们首次建立了具有线性函数逼近的单时间尺度 actor-critic 的收敛速率与全局最优性。而且,在具有非线性函数逼近的策略优化这一更广范畴下,我们首次证明带有深度神经网络的 actor-critic 以次线性速率找到全局最优策略。
引用
@article{arxiv.2008.00483,
title = {Single-Timescale Actor-Critic Provably Finds Globally Optimal Policy},
author = {Zuyue Fu and Zhuoran Yang and Zhaoran Wang},
journal= {arXiv preprint arXiv:2008.00483},
year = {2021}
}