中文

通过解析最优策略梯度学习敏捷穿越窄门

机器人学 2026-03-06 v4

摘要

穿越狭窄的门是一个重大挑战,并已成为评估敏捷和精确四旋翼飞行器飞行的标准基准。传统的模块化自主飞行系统需要大量的设计和参数调整,而端到端强化学习(RL)方法通常存在样本效率低、可解释性有限以及在未见扰动下抗扰性能退化的问题。在这项工作中,我们提出了一种新颖的混合框架,利用离线训练的神经网络(NN)的输出在线自适应微调模型预测控制(MPC)参数。该 NN 以门角点坐标和当前无人机状态为条件,联合预测参考位姿和代价函数权重。为了实现高效训练,我们不仅为 MPC 模块推导了解析策略梯度,还为基于优化的穿越门检测模块推导了解析策略梯度。硬件实验展示了峰值加速度达 30 m/s230\ \mathrm{m/s^2} 的敏捷且准确的穿越门飞行,以及在超过 1146 deg/s1146\ \mathrm{deg/s} 的机体角速率扰动后 0.85 s0.85\ \mathrm{s} 内的恢复能力。

关键词

引用

@article{arxiv.2508.21592,
  title  = {Learning Agile Gate Traversal via Analytical Optimal Policy Gradient},
  author = {Tianchen Sun and Bingheng Wang and Nuthasith Gerdpratoom and Longbin Tang and Yichao Gao and Lin Zhao},
  journal= {arXiv preprint arXiv:2508.21592},
  year   = {2026}
}

备注

8 pages, 8 figures