中文

面向 UAV 的基于视觉-语言导航与开放词汇目标理解

机器人学 2025-06-13 v1 人工智能

摘要

视觉-语言导航(VLN)是自主机器人领域的一个长期挑战,旨在赋予智能体在复杂环境中遵循人类指令的能力。该领域仍存在两个关键瓶颈:对分布外环境的泛化能力不足以及对固定离散动作空间的依赖。为了解决这些挑战,我们提出了 Vision-Language Fly(VLFly),一个专为无人驾驶飞行器(UAV)设计的执行语言引导飞行的框架。无需定位或主动测距传感器,VLFly 仅从机载单目相机捕获的自我中心观测中输出连续速度指令。VLFly 集成了三个模块:基于大型语言模型(LLM)的指令编码器,将高层语言重构为结构化提示;由视觉-语言模型(VLM)驱动的目标检索器,通过视觉-语言相似性将这些提示与目标图像匹配;以及路径点规划器,为实时 UAV 控制生成可执行轨迹。VLFly 在多样化的仿真环境中进行了评估,无需额外微调,并持续优于所有基线方法。此外,在室内和室外环境中的真实 VLN 任务,在直接和间接指令下均表明,VLFly 实现了稳健的开放词汇目标理解和泛化导航能力,即使在存在抽象语言输入的情况下也是如此。

关键词

引用

@article{arxiv.2506.10756,
  title  = {Grounded Vision-Language Navigation for UAVs with Open-Vocabulary Goal Understanding},
  author = {Yuhang Zhang and Haosheng Yu and Jiaping Xiao and Mir Feroskhan},
  journal= {arXiv preprint arXiv:2506.10756},
  year   = {2025}
}