探索空间表征以提升空中视觉-语言导航中的大型语言模型推理能力
机器人学
2025-08-12 v3 人工智能
摘要
空中视觉-语言导航 (VLN) 是一种新任务,使无人机 (UAV) 能通过自然语言指令和视觉线索在户外环境中导航。然而,由于空中场景中复杂的空间关系,此任务仍具有挑战性。本文提出了一种无训练、零shot框架用于空中VLN任务,其中大型语言模型 (LLM) 作为代理人用于动作预测。具体而言,我们开发了一种新型语义-拓扑-度量表示 (STMR) 以增强LLM的空间推理能力。这是通过从指令中提取并投影到顶视图上的语义掩码实现的,呈现关于周围地标的空间和拓扑信息,并在导航过程中逐步增长。在每一步,从增长中的顶视图中提取以UAV为中心的局部图,并转换为带有距离度量的矩阵表示,作为文本提示输入LLM,以作出针对给定指令的动作预测。在真实和仿真环境中的实验表明,我们的方法在简单和复杂导航任务中均具有有效性和鲁棒性,分别实现了26.8%和5.8%的绝对成功率提升,显著优于当前最先进的方法。该数据集和代码将很快公开。
关键词
引用
@article{arxiv.2410.08500,
title = {Exploring Spatial Representation to Enhance LLM Reasoning in Aerial Vision-Language Navigation},
author = {Yunpeng Gao and Zhigang Wang and Pengfei Han and Linglin Jing and Dong Wang and Bin Zhao},
journal= {arXiv preprint arXiv:2410.08500},
year = {2025}
}