看、指、飞:一种用于通用无人机航空导航的无学习 VLM 框架
机器人学
2025-10-15 v1 人工智能
计算与语言
计算机视觉与模式识别
机器学习
摘要
我们提出了 See, Point, Fly (SPF),这是一个构建于视觉语言模型(VLMs)之上的免训练航空视觉语言导航(AVLN)框架。SPF 能够在任何类型的环境中,根据任何类型的自由格式指令导航至任意目标。与现有的基于 VLM 的方法将动作预测视为文本生成任务不同,我们的关键见解是将 AVLN 的动作预测视为一项 2D 空间定位任务。SPF 利用 VLM 将模糊的语言指令分解为输入图像上 2D 航点的迭代标注。结合预测的行进距离,SPF 将预测的 2D 航点转换为 3D 位移向量,作为无人机(UAV)的动作指令。此外,SPF 还能自适应地调整行进距离,以促进更高效的导航。值得注意的是,SPF 以闭环控制方式进行导航,使无人机能够在动态环境中跟随动态目标。SPF 在 DRL 仿真基准测试中创造了新的技术水平,以 63% 的绝对优势超越了之前的最优方法。在广泛的真实世界评估中,SPF 以大幅优势超越了强大的基线。我们还进行了全面的消融研究,以突出我们设计选择的有效性。最后,SPF 展示了对不同 VLM 的显著泛化能力。项目页面:https://spf-web.pages.dev
引用
@article{arxiv.2509.22653,
title = {See, Point, Fly: A Learning-Free VLM Framework for Universal Unmanned Aerial Navigation},
author = {Chih Yao Hu and Yang-Sen Lin and Yuna Lee and Chih-Hai Su and Jie-Ying Lee and Shr-Ruei Tsai and Chin-Yang Lin and Kuan-Wen Chen and Tsung-Wei Ke and Yu-Lun Liu},
journal= {arXiv preprint arXiv:2509.22653},
year = {2025}
}
备注
CoRL 2025. Project page: https://spf-web.pages.dev