中文

面向时间最优四旋翼飞行的端到端强化学习

机器人学 2024-12-23 v1

摘要

四旋翼的时间最优激进控制是机器人领域的重大挑战。当前最优方法利用强化学习(RL)训练最优神经策略。然而,一个关键障碍是仿真到现实的差距,通常通过采用鲁棒内环控制器来解决——这种抽象在理论上限制了训练控制器的最优性,需要余量来抵消潜在扰动。相比之下,我们的新方法引入使用端到端 RL(E2E)的高速四旋翼控制,直接输出电机指令。为弥合现实差距,我们融入了学习的残差模型与可补偿推力和力矩建模误差的自适应方法。我们在仿真和真实飞行中将 E2E 方法与一个向 INDI 内环控制器指令推力和机体角速率的 SOTA 网络进行比较。E2E 在仿真中展现 1.39 秒的显著优势,在真实测试中具备 0.17 秒的领先,凸显了端到端强化学习的潜力。从仿真到现实观察到的性能下降表明仍有改进空间,包括优化应对现实差距的策略或利用真实飞行数据探索离线强化学习。

关键词

引用

@article{arxiv.2311.16948,
  title  = {End-to-end Reinforcement Learning for Time-Optimal Quadcopter Flight},
  author = {Robin Ferede and Christophe De Wagter and Dario Izzo and Guido C. H. E. de Croon},
  journal= {arXiv preprint arXiv:2311.16948},
  year   = {2024}
}

备注

6 pages, 6 figures, 1 table