使用可微分仿真从视觉特征学习四旋翼控制
机器人学
2026-01-16 v3
摘要
强化学习(RL)的样本效率问题仍是机器人领域的重大挑战。RL需要大量仿真数据,仍可能导致长时间的训练, slowing research and innovation。在视觉基控制任务中,由于可靠的状态估计不可得,这一问题尤为突出。可微分仿真提供了一种替代方案,使能够通过动力学模型进行梯度反向传播,提供低方差的解析策略梯度,从而实现更高的样本效率。然而,其在实际机器人任务中的应用仍有限。本文展示了可微分仿真在学习四旋翼控制方面的巨大潜力。我们表明,在提供车辆状态时,可微分仿真的训练在样本效率和训练时间方面显著优于无模型RL,使策略能够在秒级恢复四旋翼,在分钟级仅依赖视觉特征时也能学习。成功的关键在于两方面:其一,使用简单的代理模型进行梯度计算可大幅加速训练,而不牺牲控制性能;其二,将状态表示学习与策略学习结合,可增强仅依赖视觉特征可观测任务中的收敛速度。这些发现凸显了可微分仿真在实际机器人中的潜力,为传统RL方法提供了有力替代方案。
引用
@article{arxiv.2410.15979,
title = {Learning Quadrotor Control From Visual Features Using Differentiable Simulation},
author = {Johannes Heeg and Yunlong Song and Davide Scaramuzza},
journal= {arXiv preprint arXiv:2410.15979},
year = {2026}
}
备注
Accepted for presentation at the IEEE International Conference on Robotics and Automation (ICRA) 2025