中文

面向高维机器人跟踪控制的数据驱动残差强化学习

系统与控制 2024-06-10 v5 系统与控制

摘要

从零开始的强化学习(RL)学习效率低下,阻碍了其在实际连续机器人跟踪控制中的应用,尤其对于高维机器人。本文提出一种基于数据驱动残差强化学习(DR-RL)的机器人跟踪控制方案,适用于高维机器人。所提 DR-RL 方法在样本效率与可扩展性上优于常见 RL 方法。具体而言,我们首先将原始机器人解耦为低维机器人子系统;进而利用一步回溯(OSBK)数据构造增量子系统,其等价于上述解耦机器人子系统的无模型表示。所构造的增量子系统支持并行学习以缓解计算负载,并为我们提供机器人运动的数学描述以进行理论分析。随后,我们在并行学习架构下应用 DR-RL 学习跟踪控制策略,该策略由增量基策略与增量残差策略组合而成。增量残差策略以增量基策略的引导作为学习初始化,并进一步从与环境的交互中学习,使跟踪控制策略具备对动态变化环境的适应性。我们所提基于 DR-RL 的跟踪控制方案配有系统稳定性与权值收敛的严格理论分析。所提方法的有效性在 7 自由度 KUKA iiwa 机器人机械臂上经数值验证,并在 3 自由度机器人机械臂上经实验验证,而其它同类 RL 方法在该实验上会失效。

关键词

引用

@article{arxiv.2110.15237,
  title  = {Data Informed Residual Reinforcement Learning for High-Dimensional Robotic Tracking Control},
  author = {Cong Li and Fangzhou Liu and Yongchao Wang and Martin Buss},
  journal= {arXiv preprint arXiv:2110.15237},
  year   = {2024}
}