利用对称性加速自由飞行机器人系统轨迹跟踪控制器的学习
机器人学
2025-05-05 v3 机器学习
系统与控制
系统与控制
摘要
轨迹跟踪控制器使机器人系统能够精确地遵循计划好的参考轨迹。特别是,强化学习(RL)在合成具有复杂动力学且在线计算资源有限的系统控制器方面显示出前景。然而,RL的样本效率较差以及奖励设计的挑战,使得训练过程缓慢且可能不稳定,尤其是对于高维系统而言。本文利用具有浮动基座的机器人系统固有的李群对称性,以缓解这些挑战。我们将一般的跟踪问题建模为马尔可夫决策过程(MDP),该过程捕获了物理状态和参考状态的演化。随后,我们证明了动态和运行成本中的对称性导致MDP同构,这是一种映射,允许在低维“商”MDP上训练的策略被提升为原始系统的最优跟踪控制器。我们将对称性感知的方法与非结构化基线进行比较,使用Proximal Policy Optimization(PPO)学习三个系统的跟踪控制器:Particle(受控点质量),Astrobee(完全可操控的空间机器人),以及Quadrotor(受约束系统)。结果表明,对称性感知的方法既加速了训练,又在收敛时降低了跟踪误差。
引用
@article{arxiv.2409.11238,
title = {Leveraging Symmetry to Accelerate Learning of Trajectory Tracking Controllers for Free-Flying Robotic Systems},
author = {Jake Welde and Nishanth Rao and Pratik Kunapuli and Dinesh Jayaraman and Vijay Kumar},
journal= {arXiv preprint arXiv:2409.11238},
year = {2025}
}
备注
The first three authors contributed equally to this work. This updated version reflects the final version to appear at IEEE International Conference on Robotics and Automation (ICRA) 2025