中文

收缩演员-批评家:基于收缩度量引导的鲁棒路径跟踪强化学习

机器学习 2025-06-23 v1 人工智能

摘要

控制收缩度量(Contraction Metric, CCM)为协同设计控制器及相应收缩度量提供了框架——这是一种正定黎曼度量,确保闭环系统在其下具有递增指数稳定性。然而,所设计的控制器仅确保系统所有轨迹收敛至单一轨迹,因而未对整个轨迹范围内的最优性提供任何概念。此外,构建CCM需要已知的系统动力学模型,以及解决无穷维凸可行性问题的非平凡工作,这限制了其在高维不确定系统上的可扩展性。为此,我们提出将CCM集成到强化学习(RL)中,使CCM为具有不确定动力学的控制策略提供动力学导向的反馈,以最小化累积跟踪误差。我们证明,所提算法称收缩演员-批评家(contraction actor-critic, CAC),正式增强了CCM提供收缩策略能力与RL在完全自动化设置下长期最优性的结合。给定预训练的动力学模型后,CAC同时学习一个收缩度量生成器(CMG)——用于生成收缩度量——并利用演员-批评家算法以该度量为指导学习最优跟踪策略。我们通过大量实证研究(包括仿真和实际机器人实验)展示了该算法相对于既定基准的有效性,并为将收缩理论引入RL提供了理论依据。

关键词

引用

@article{arxiv.2506.15700,
  title  = {Contraction Actor-Critic: Contraction Metric-Guided Reinforcement Learning for Robust Path Tracking},
  author = {Minjae Cho and Hiroyasu Tsukamoto and Huy Trong Tran},
  journal= {arXiv preprint arXiv:2506.15700},
  year   = {2025}
}