利用几何对称性进行无人机 aerobatics 多任务强化学习
机器人学
2026-02-12 v1
摘要
无人机飞行控制从接近平衡点的稳定飞行演变为更激进的机动,如翻转、翻滚和 Power Loop。尽管强化学习(RL)在这些任务中显示出巨大潜力,但常规 RL 方法往往 suffers from 数据效率低和泛化有限。这种挑战在多任务场景中更为突出,因为需要学习一种能够掌握多种机动的单一策略。本文提出一种新型的端到端多任务强化学习框架,称为 GEAR(Geometric Equivariant Aerobatics Reinforcement),充分利用 MAV 动态中固有的 SO(2) 旋转对称性,并将这一属性明确地纳入策略网络架构。通过集成等变演员网络、FiLM-based 任务调制和多头批评家,GEAR 在学习多样化 aerobatics 机动方面实现了效率和灵活性,使其成为一种数据高效、稳健且统一的 aerobatics 控制框架。GEAR 在各种 aerobatics 任务中实现了 98.85% 的成功率,显著优于基线方法。在实际实验中,GEAR 显示出执行多种机动和将基本运动原语组合以完成复杂 aerobatics 的能力。
引用
@article{arxiv.2602.10997,
title = {Multi-Task Reinforcement Learning of Drone Aerobatics by Exploiting Geometric Symmetries},
author = {Zhanyu Guo and Zikang Yin and Guobin Zhu and Shiliang Guo and Shiyu Zhao},
journal= {arXiv preprint arXiv:2602.10997},
year = {2026}
}