学习四旋翼控制的零样本 Sim-to-Real 强化学习策略的关键因素:一项综合研究
机器人学
2025-05-23 v4 机器学习
摘要
执行精确和敏捷的飞行机动对于四旋翼在各种应用中至关重要。传统的四旋翼控制方法受限于对平坦轨迹或耗时的优化的依赖,这限制了它们的灵活性。最近,基于 RL 的策略已成为一种有前景的替代方案,因为它能够直接将观测映射到动作,减少了对详细系统知识和驱动约束的需求。然而,弥合 sim-to-real 差距仍然是一个重大挑战,基于 RL 的策略在部署到真实世界时经常出现不稳定。在本文中,我们研究了学习能够零样本部署到真实世界四旋翼的鲁棒 RL 控制策略的关键因素。我们确定了五个关键因素,并开发了一个名为 SimpleFlight 的基于 PPO 的训练框架,该框架集成了这五种技术。我们在 Crazyflie 四旋翼上验证了 SimpleFlight 的有效性,表明与最先进的 RL 基线相比,其轨迹跟踪误差减少了 50% 以上。由 SimpleFlight 导出的策略在低推重比四旋翼上的平滑多项式轨迹和具有挑战性的不可行锯齿轨迹上均始终表现出色。相比之下,基线方法在处理高速或不可行轨迹时表现不佳。为了支持进一步的研究和可复现性,我们将 SimpleFlight 集成到基于 GPU 的模拟器 Omnidrones 中,并提供了代码和模型检查点的开源访问。我们希望 SimpleFlight 能为推进基于 RL 的四旋翼控制提供有价值的见解。更多详情,请访问我们的项目网站:https://sites.google.com/view/simpleflight/。
引用
@article{arxiv.2412.11764,
title = {What Matters in Learning A Zero-Shot Sim-to-Real RL Policy for Quadrotor Control? A Comprehensive Study},
author = {Jiayu Chen and Chao Yu and Yuqing Xie and Feng Gao and Yinuo Chen and Shu'ang Yu and Wenhao Tang and Shilong Ji and Mo Mu and Yi Wu and Huazhong Yang and Yu Wang},
journal= {arXiv preprint arXiv:2412.11764},
year = {2025}
}
备注
The first two authors contribute equally; Accepted by RA-L