如何训练你的四旋翼:一种通过强化学习实现持续平滑且响应迅速飞行控制的框架
机器人学
2021-10-14 v2 系统与控制
系统与控制
摘要
我们关注在嵌入式系统中可靠地训练强化学习(RL)模型(智能体)以实现稳定底层控制的问题,并在一个高性能定制四旋翼平台上测试了我们的方法。在开发连续控制 RL 智能体时,一个常见却常被低估的问题是所开发的控制策略并非总是平滑的。这种不平滑在部署于真实硬件的控制器学习中会成为主要问题,因为它可导致控制失稳与硬件故障。当在仿真中训练 RL 智能体时,由于模拟器本质上是对现实的不完美表征——即所谓的现实差距(reality gap),噪声控制问题进一步加剧。为应对 RL 智能体中的不稳定性问题,我们提出一个系统性框架“通过学习的可迁移强化智能体”(RE+AL),用于设计在迁移至真实平台时能保持智能体训练质量的仿真训练环境。RE+AL 是我们研究小组成员技术报告中详述的 Neuroflight 基础设施的演进。Neuroflight 是用于训练底层姿态控制 RL 智能体的最先进框架。RE+AL 通过解决阻碍 Neuroflight 部署到真实硬件的若干重要局限,对其进行了改进与完善。我们在作为 Neuroflight 一部分开发的 NF1 竞速四旋翼上对 RE+AL 进行基准测试。我们证明 RE+AL 显著缓解了先前观察到的 RL 智能体平滑性问题。此外,RE+AL 始终能训练出可飞行且在迁移时控制器质量退化最小的智能体。RE+AL 智能体还学会优于调优的 PID 控制器,具有更好的跟踪误差、更平滑的控制以及更低的功耗。
引用
@article{arxiv.2012.06656,
title = {How to Train your Quadrotor: A Framework for Consistently Smooth and Responsive Flight Control via Reinforcement Learning},
author = {Siddharth Mysore and Bassel Mabsout and Kate Saenko and Renato Mancuso},
journal= {arXiv preprint arXiv:2012.06656},
year = {2021}
}