中文

GeoNav:赋能多模态大语言模型以实现双尺度地理空间推理的语言目标航空导航

机器人学 2026-03-10 v4

摘要

语言目标航空导航要求无人机在复杂户外环境中基于文本指令定位目标,例如在城市街区内。室内方法常常难以扩展到城市场景,因为其中存在模糊对象、视野受限以及空间推理问题。本文提出GeoNav,一个具备地理空间感知能力的长距离航空导航多模态智能体。GeoNav在三个阶段内运行——地标导航、目标搜索和精确定位——模拟人类的粗到细空间推理模式。为支持此类推理,它动态构建双尺度空间表示。第一是全局但略图的认知地图,将先验地理知识和具身视觉线索融合成自上而下的显式标注形式, enables 通过直观的基于地图的推理快速导航至地标区域。第二是在局部但精细的场景图中,表示地标与物体之间的层次化空间关系,用于精确目标定位。在结构化记忆之上,GeoNav采用空间链式思维机制,使多模态大语言模型能够在各阶段实现高效且可解释的行动决策。在CityNav基准测试中,GeoNav相较于当前SOTA方法在成功率上提升了最高可达18.4%,显著消除了导航误差。消融研究突显了各模块的重要性,将结构化空间感知定位为先进无人机导航的关键。论文将于2026年发表于Pattern Recognition。

关键词

引用

@article{arxiv.2504.09587,
  title  = {GeoNav: Empowering MLLMs with dual-scale geospatial reasoning for language-goal aerial navigation},
  author = {Haotian Xu and Yue Hu and Chen Gao and Zhengqiu Zhu and Yong Zhao and Yong Li and Quanjun Yin},
  journal= {arXiv preprint arXiv:2504.09587},
  year   = {2026}
}

备注

Published in Pattern Recognition (2026)