SOUS VIDE:在高斯光场真空中烹制视觉无人机导航策略
机器人学
2025-03-24 v2 计算机视觉与模式识别
机器学习
系统与控制
系统与控制
摘要
我们提出了一个新的模拟器、训练方法和策略架构,总称为 SOUS VIDE,用于端到端视觉无人机导航。我们的训练策略在零样 sim-to-real 迁移下表现出稳健的实际性能,仅使用 onboard 感知和计算。我们的模拟器称为 FiGS,将计算简单的无人机动力学模型与高视觉保真度的高斯光场场景重建相耦合。FiGS 能快速模拟无人机飞行,在最高可达 130 fps 的速度下生成照片逼真的图像。我们使用 FiGS 从专家 MPC(拥有特权状态和动力学信息)收集 100k-300k 图像/状态-动作对,这些数据随机化了动力学参数和空间扰动。我们随后将该专家 MPC 提炼为一个端到端 visuomotor 策略,采用轻量级神经网络架构,称为 SV-Net。SV-Net 处理颜色图像、光流和 IMU 数据流, onboard 在无人机上以 20 Hz 的速度输出低层推力和身体率命令。关键的是,SV-Net 包含一个在运行时适应无人机动力学变化的学习型低层控制模块。在一系列 105 项硬件实验中,我们展示 SOUS VIDE 的策略对 30% 质量变化、40 m/s 风力gust、60% 水平亮度变化、场景中物体的移动或移除,以及穿过无人机视野的 aggressive 人群 movement 都表现出鲁棒性。代码、数据和实验视频可在我们的项目页面上查找到:https://stanfordmsl.github.io/SousVide/。
引用
@article{arxiv.2412.16346,
title = {SOUS VIDE: Cooking Visual Drone Navigation Policies in a Gaussian Splatting Vacuum},
author = {JunEn Low and Maximilian Adang and Javier Yu and Keiko Nagami and Mac Schwager},
journal= {arXiv preprint arXiv:2412.16346},
year = {2025}
}