SINGER:面向无人机的机载通用视觉-语言导航策略
机器人学
2025-09-24 v1
摘要
大型视觉-语言模型推动了开放词表机器人策略(例如通用机器人操作策略)的显著进展,使机器人能够完成以自然语言指定的复杂任务。尽管取得了这些成功,但由于缺乏大规模演示数据、无人机悬停对实时控制的要求以及缺少可靠的外部位姿估计模块,开放词表自主无人机导航仍是一个未解决的挑战。在本工作中,我们提出 SINGER,仅使用机载传感与计算来实现开放世界中语言引导的自主无人机导航。为训练鲁棒的开放词表导航策略,SINGER 利用三个核心组件:(i) 一个基于 Gaussian Splatting 的真实感语言嵌入飞行模拟器,具有最小的 sim-to-real 差距,用于高效数据生成;(ii) 一个受 RRT 启发的多轨迹生成专家,用于无碰撞导航演示;这些被用于训练 (iii) 一个用于实时闭环控制的轻量级端到端视觉运动策略。通过广泛的硬件飞行实验,我们展示了我们的策略向未见环境及未见语言条件目标物体的卓越零样本 sim-to-real 迁移能力。当在约 70 万至 100 万个语言条件视觉运动数据的观测-动作对上进行训练并部署于硬件时,SINGER 优于速度控制语义引导基线,平均到达查询目标的次数多 23.33%,平均将查询目标保持在视野内的次数多 16.67%,且碰撞次数减少 10%。
引用
@article{arxiv.2509.18610,
title = {SINGER: An Onboard Generalist Vision-Language Navigation Policy for Drones},
author = {Maximilian Adang and JunEn Low and Ola Shorinwa and Mac Schwager},
journal= {arXiv preprint arXiv:2509.18610},
year = {2025}
}