中文

MAVEN:用于敏捷四旋翼机动中的可变动力学专长的元强化学习框架

机器人学 2026-03-12 v1

摘要

尽管强化学习(RL)已成为实现四旋翼机在线敏捷导航的强大方法,但通过标准 RL 训练的策略在面对显著动力学变化时往往难以泛化,缺乏关键的适应性。本文引入 MAVEN(Meta-Reinforcement Learning for Varying-Dynamics Expertise),一种元 RL 框架,使单个策略能够在广泛的四旋翼动力学范围内实现稳健的端到端导航。我们的方法包含一种新颖的预测上下文编码器,从交互历史中学习推断系统动力学的潜在表征。我们在两种具有挑战性的场景下进行实验:四旋翼质量的大幅变化以及严重的单电机推力损失。我们利用 GPU 向量化模拟器将任务在数千个平行环境中分布式运行,克服了元 RL 长时间训练的瓶颈,使其在不到一个小时内收敛。通过大量实验(包括仿真和实际环境),我们验证 MAVEN 实现了卓越的适应性和灵活性。该策略成功完成了零样本仿真到现实的迁移,展示了在质量变化可达 66.7% 且单电机推力损失可达 70% 的情况下,仍能执行高速机动的鲁棒在线适应能力。

关键词

引用

@article{arxiv.2603.10714,
  title  = {MAVEN: A Meta-Reinforcement Learning Framework for Varying-Dynamics Expertise in Agile Quadrotor Maneuvers},
  author = {Jin Zhou and Dongcheng Cao and Xian Wang and Shuo Li},
  journal= {arXiv preprint arXiv:2603.10714},
  year   = {2026}
}