线性二次调节器的异步并行策略梯度方法
最优化与控制
2024-07-04 v1
摘要
以异步并行方式学习策略是强化学习在解决大规模问题上取得众多成功的关键。然而,其收敛性能仍未得到严格评估。为此,我们采用异步并行零阶策略梯度(AZOPG)方法来求解连续时间线性二次调节问题。具体而言,如同著名的 A3C 算法,多个并行工作线程异步估计策略梯度,随后将其发送至中央主节点进行策略更新。通过量化其策略迭代的收敛速率,我们在理论和仿真中均证明了 AZOPG 的线性加速特性,这清楚地揭示了使用并行工作线程学习策略的优势。
引用
@article{arxiv.2407.03233,
title = {Asynchronous Parallel Policy Gradient Methods for the Linear Quadratic Regulator},
author = {Xingyu Sha and Feiran Zhao and Keyou You},
journal= {arXiv preprint arXiv:2407.03233},
year = {2024}
}
备注
This article was submitted to IEEE TAC on Jan. 10, 2024