中文

单时间尺度 actor-critic 的有限时间分析

机器学习 2024-01-29 v4 最优化与控制 机器学习

摘要

Actor-critic 方法在许多具有挑战性的应用中取得了显著成功。然而,其有限时间收敛性在最实用的单时间尺度形式下仍知之甚少。现有关于单时间尺度 actor-critic 的分析工作为简便起见仅限于 i.i.d. 采样或表格设置。我们研究了更实用的连续状态空间上的在线单时间尺度 actor-critic 算法,其中评论家采用线性函数近似,并在每个 actor 步使用单个马尔可夫样本更新。先前的分析未能针对这一困难场景建立收敛性。我们证明,在标准假设下,在线单时间尺度 actor-critic 方法可证明地以 O~(ϵ2)\widetilde{\mathcal{O}}(\epsilon^{-2}) 的样本复杂度找到 ϵ\epsilon-近似驻点,在 i.i.d. 采样下可进一步改进至 O(ϵ2)\mathcal{O}(\epsilon^{-2})。我们的新框架系统地评估并控制 actor 与 critic 之间的误差传播。它也为分析其他单时间尺度强化学习算法提供了有前景的途径。

关键词

引用

@article{arxiv.2210.09921,
  title  = {Finite-time analysis of single-timescale actor-critic},
  author = {Xuyang Chen and Lin Zhao},
  journal= {arXiv preprint arXiv:2210.09921},
  year   = {2024}
}