VisFly-Lab:面向四旋翼控制的统一可微分强化学习框架
机器人学
2026-03-24 v1
摘要
基于可微分仿真的一次阶强化学习在四旋翼控制领域具有前景,但实际进展在任务特定设置之间仍显碎片化。为支持更系统的开发与评估,我们提出了一个用于多任务四旋翼控制的统一可微分框架。该框架封装、可扩展,并配备了面向部署的动力学,提供了涵盖悬停、跟踪、着陆和赛跑四个典型任务的统一接口。我们还提供了一系列一次阶学习算法,其中指出了标准一次阶训练的两个实际瓶颈:由时域初始化导致的状态覆盖不足,以及部分非可微分奖励导致的梯度偏差。为解决这些问题,我们提出了Amended Backpropagation Through Time (ABPT),其结合了可微分滚动优化、基于价值的辅助目标和访问状态初始化,以提高训练的鲁棒性。实验结果表明,ABPT在部分非可微分奖励的任务中取得最明显的提升,而在完全可微分的设置中仍保持竞争力。我们进一步提供了实际部署的概念证明,显示了框架中学习的策略在仿真之外的初始可迁移性。
引用
@article{arxiv.2603.21123,
title = {VisFly-Lab: Unified Differentiable Framework for First-Order Reinforcement Learning of Quadrotor Control},
author = {Fanxing Li and Fangyu Sun and Tianbao Zhang and Shuyu Wu and Dexin Zuo and yufei Yan and Wenxian Yu and Danping Zou},
journal= {arXiv preprint arXiv:2603.21123},
year = {2026}
}