中文

通过解析策略梯度训练高效控制器

机器人学 2023-05-04 v3 人工智能

摘要

机器人系统的控制设计十分复杂,常需求解优化以精确跟踪轨迹。模型预测控制(MPC)等在线优化方法已实现优异的跟踪性能,但需较高计算力。反之,基于学习的离线优化方法(如强化学习(RL))可在机器人上快速高效执行,却难以在轨迹跟踪任务中匹敌MPC的精度。在计算受限的系统(如飞行器)中,执行时高效且精确的控制器必不可少。我们提出解析策略梯度(APG)方法来解决该问题。APG利用可微仿真器的可用性,通过基于跟踪误差的梯度下降离线训练控制器。我们通过课程学习解决了APG频繁出现的训练不稳定性,并在广泛使用控制基准CartPole及两种常见飞行器(四旋翼与固定翼无人机)上实验。所提方法在跟踪误差上优于基于模型与无模型的RL方法,同时取得与MPC相近的性能,而所需计算时间少一个数量级以上。我们的工作揭示了APG作为机器人学中有前景控制方法的潜力。为便于探索APG,我们开源了代码,参见 https://github.com/lis-epfl/apg_trajectory_tracking。

关键词

引用

@article{arxiv.2209.13052,
  title  = {Training Efficient Controllers via Analytic Policy Gradient},
  author = {Nina Wiedemann and Valentin Wüest and Antonio Loquercio and Matthias Müller and Dario Floreano and Davide Scaramuzza},
  journal= {arXiv preprint arXiv:2209.13052},
  year   = {2023}
}