连续状态-动作空间下单时间尺度 Actor-Critic 方法的全局最优性:以线性二次调节器为例
机器学习
2025-05-09 v1
摘要
Actor-Critic方法在各种具有挑战性的任务中取得了最先进的性能。然而,关于其性能的理论理解仍然尚且含糊且具有挑战性。现有研究大多Focus于实际不太常见的变体,如双环或双时间尺度步长Actor-Critic算法以简化问题。这些结果仅保证在有限状态或动作空间上实现局部收敛。我们将边界推向研究经典的单样本单时间尺度Actor-Critic在连续(无限)状态-动作空间上的情况,其中我们采用标准线性二次调节器 (LQR) 问题作为案例研究。我们表明,流行的单时间尺度Actor-Critic能够以到的样本复杂度求解LQR以获得近似最优解。我们的工作为单时间尺度Actor-Critic的性能提供了新的见解,进一步弥合了理论与实践之间的差距。
引用
@article{arxiv.2505.01041,
title = {Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator},
author = {Xuyang Chen and Jingliang Duan and Lin Zhao},
journal= {arXiv preprint arXiv:2505.01041},
year = {2025}
}
备注
arXiv admin note: substantial text overlap with arXiv:2208.08744