中文

具有相位执行器的演员-评论家强化学习

机器学习 2024-04-19 v1

摘要

演员-评论家强化学习(RL)中的策略梯度方法已成为解决连续最优控制问题最有前景的方法之一。然而,RL的试错性质以及解近似中固有的随机性导致学习到的最优值和策略存在变化。这严重阻碍了它们在需要控制响应确定性满足动态性能标准的实际应用中的成功部署。本文提出了一种新颖的演员-评论家中的相位执行器(PAAC)方法,旨在改进策略梯度估计,从而提高控制策略的质量。具体来说,PAAC在其执行器更新中同时考虑了Q值和TD误差。我们证明了PAAC在值和策略的学习收敛性、解最优性以及系统动力学稳定性方面的定性性质。此外,我们展示了策略梯度估计中的方差减少。本研究使用DeepMind控制套件(DMC)对PAAC性能进行了系统定量评估。结果表明,PAAC在总成本、学习方差、鲁棒性、学习速度和成功率方面带来了显著的性能提升。由于PAAC可以附加到一般的策略梯度学习框架上,我们选择了诸如直接启发式动态规划(dHDP)、深度确定性策略梯度(DDPG)及其变体等知名方法来展示PAAC的有效性。因此,我们为这些相关的策略梯度算法提供了一个统一的视角。

关键词

引用

@article{arxiv.2404.11834,
  title  = {Actor-Critic Reinforcement Learning with Phased Actor},
  author = {Ruofan Wu and Junmin Zhong and Jennie Si},
  journal= {arXiv preprint arXiv:2404.11834},
  year   = {2024}
}