中文

单时间尺度 actor-critic 可证明找到全局最优策略

机器学习 2021-06-15 v2 最优化与控制 机器学习

摘要

我们研究 actor-critic(最流行的强化学习算法族之一)的全局收敛性与全局最优性。虽然现有关于 actor-critic 的工作大多采用双层或双时间尺度更新,我们聚焦于更实用的单时间尺度设定,即 actor 与 critic 同时更新。具体而言,在每次迭代中,critic 更新通过仅应用一次 Bellman 评估算子获得,而 actor 使用由 critic 计算的策略梯度方向更新。此外,我们考虑两种函数逼近设定,其中 actor 与 critic 均由线性或深度神经网络表示。对于两种情况,我们均证明 actor 序列以次线性 O(K1/2)O(K^{-1/2}) 速率收敛到全局最优策略,其中 KK 为迭代次数。据我们所知,我们首次建立了具有线性函数逼近的单时间尺度 actor-critic 的收敛速率与全局最优性。而且,在具有非线性函数逼近的策略优化这一更广范畴下,我们首次证明带有深度神经网络的 actor-critic 以次线性速率找到全局最优策略。

关键词

引用

@article{arxiv.2008.00483,
  title  = {Single-Timescale Actor-Critic Provably Finds Globally Optimal Policy},
  author = {Zuyue Fu and Zhuoran Yang and Zhaoran Wang},
  journal= {arXiv preprint arXiv:2008.00483},
  year   = {2021}
}