UAV-VLN:面向无人机的端到端视觉语言导航
机器人学
2025-10-01 v1 计算机视觉与模式识别
摘要
AI 指导的自主系统的一个核心挑战在于,使代理能够基于自然语言指令在此前未遇到的环境中实现真实且有效的导航。我们提出了 UAV-VLN,一个为无人机 (UAV) 设计的新型端到端视觉语言导航 (VLN) 框架,无缝集成大语言模型 (LLM) 与视觉感知,以促进人机交互式导航。该系统解释自由形式的自然语言指令,将其 grounding 到视觉观测中,并在多样化环境中规划可行的航空轨迹。UAV-VLN 利用 LLM 的常识推理能力解析高层语义目标,同时视觉模型检测并定位环境中具有语义意义的对象。通过融合这些模态,无人机能够推理空间关系,消除人类指令中的歧义,并以最小的任务特定监督规划情境感知行为。为确保稳健且可解释的决策,框架包括一种跨模态 grounding 机制,将语言意图与视觉情境对齐。我们在多样化的室内外导航场景中评估了 UAV-VLN,证明了其能够针对新指令和环境进行概括,且所需的任务特定训练最小。结果在指令遵循准确率和轨迹效率方面均取得显著提升,凸显了 LLM 驱动的视觉语言界面在安全、直观且可概括的无人机自主性方面的潜力。
关键词
引用
@article{arxiv.2504.21432,
title = {UAV-VLN: End-to-End Vision Language guided Navigation for UAVs},
author = {Pranav Saxena and Nishant Raghuvanshi and Neena Goveas},
journal= {arXiv preprint arXiv:2504.21432},
year = {2025}
}