中文

求解线性二次调节器的双时间尺度行动者-评论者算法的全局收敛性

机器学习 2023-02-28 v2

摘要

行动者-评论者(AC)强化学习算法一直是许多具有挑战性应用背后的核心动力。然而,其收敛性总体上较为脆弱。为研究其不稳定性,现有工作大多考虑不常见的双循环变体或具有有限状态与动作空间的基础模型。我们研究了更实用的单样本双时间尺度AC算法用于求解典型的线性二次调节器(LQR)问题,其中行动者与评论者在每次迭代中仅以单个样本更新一次,且状态与动作空间为无界连续空间。现有分析无法对此极具挑战的情形得出收敛结论。我们开发了一个新的分析框架,能够确立其以至多 O(ϵ2.5)\mathcal{O}(\epsilon^{-2.5}) 的样本复杂度全局收敛到 ϵ\epsilon-最优解。据我们所知,这是首个针对求解LQR且具有全局最优性的单样本双时间尺度AC的有限时间收敛分析。其样本复杂度比其他变体低数个数量级,这揭示了单样本算法的实践智慧。我们还通过全面的仿真对比进一步验证了理论发现。

关键词

引用

@article{arxiv.2208.08744,
  title  = {Global Convergence of Two-timescale Actor-Critic for Solving Linear Quadratic Regulator},
  author = {Xuyang Chen and Jingliang Duan and Yingbin Liang and Lin Zhao},
  journal= {arXiv preprint arXiv:2208.08744},
  year   = {2023}
}