SoraNav:基于零样例视觉语言模型推理的自适应无人机任务导向导航
机器人学
2026-03-05 v3
摘要
无人机在自然语言指令下进行自主导航代表了一种走向具身智能的关键步骤,使其能够在从工业设施到居住空间的各种环境中执行复杂任务。然而,面向无人机的语言驱动三维导航需要精确的空间推理,而当前零样例视觉语言模型(VLM)缺乏这一能力,往往生成模糊输出且无法保证几何可行性。此外,现有的视觉语言导航(VLN)方法主要针对 2.5D 地面机器人设计,无法泛化到无人机在小型拥挤环境中所需的严格三维空间推理。本文提出了SoraNav,一种新型框架,使无人机能够进行零样例 VLM 推理。为解决空间-语义鸿沟,我们引入多模态视觉标注(MVA),将三维几何先验直接编码到 VLM 的二维视觉输入中。为缓解幻觉或不可行的命令,我们提出了自适应决策制定(ADM)策略,该策略将 VLM 提议与探索历史进行验证, seamless 切换到基于几何的探索,以避免死胡同和冗余重复访问。在定制的 PX4 基础微型无人机上部署时,SoraNav 显示出稳健的实际性能。定量结果表明,我们的方法在 2.5D 场景中显著优于最先进的基线,成功率(SR)提高了 25.7%,导航效率(SPL)提高了 17.3%;在复杂 3D 场景中,分别提高了 39.3%(SR)和 24.7%(SPL)。
引用
@article{arxiv.2510.25191,
title = {SoraNav: Adaptive UAV Task-Centric Navigation via Zeroshot VLM Reasoning},
author = {Hongyu Song and Rishabh Dev Yadav and Cheng Guo and Wei Pan},
journal= {arXiv preprint arXiv:2510.25191},
year = {2026}
}