CityNavAgent:基于层次语义规划和全局记忆的空中视觉语言导航
机器人学
2025-12-29 v1 人工智能
摘要
空中视觉语言导航(VLN)要求无人机解释自然语言指令并在复杂城市环境中导航,成为一种关键的具身 AI 挑战,连接了人机交互、3D 空间推理和实际部署。尽管现有地面 VLN 代理在室内外环境中取得了显著成果,但在空中 VLN 领域仍面临挑战,主要由于缺乏预定义的导航图谱以及在长程探索中动作空间的指数级扩张。本文提出了 CityNavAgent,一个由大语言模型(LLM)驱动的代理,显著降低了城市空中 VLN 的导航复杂度。具体而言,我们设计了层次语义规划模块(HSPM),将长期任务分解为不同语义层次的子目标。该代理通过实现不同层次的子目标来逐步到达目标。此外,我们开发了全局记忆模块,将历史轨迹存储为拓扑图,以简化对已访问目标的导航。大量基准实验表明,我们的方法取得了 state-of-the-art 的性能,并实现了显著的提升。进一步的实验表明了 CityNavAgent 各模块在连续城市环境中的空中 VLN 有效性。代码已公开。
引用
@article{arxiv.2505.05622,
title = {CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global Memory},
author = {Weichen Zhang and Chen Gao and Shiquan Yu and Ruiying Peng and Baining Zhao and Qian Zhang and Jinqiang Cui and Xinlei Chen and Yong Li},
journal= {arXiv preprint arXiv:2505.05622},
year = {2025}
}