中文

面向航空视觉语言导航 History-Enhanced Two-Stage Transformer

计算机视觉与模式识别 2025-12-18 v2 机器人学

摘要

航空视觉语言导航(Aerial Vision-and-Language Navigation,AVLN)要求无人机(UAV)代理基于语言指令在大规模城市环境中定位目标。虽然成功的导航需要全局环境推理和局部场景理解,但现有的UAV代理通常采用单粒度框架,难以平衡这两个方面。为解决这一局限性,本文提出了History-Enhanced Two-Stage Transformer(HETT)框架,通过粗到细导航管道集成这两个方面。具体而言,HETT首先通过融合空间地标和历史上下文预测粗糙的目标位置,然后通过细粒度视觉分析来细化动作。此外,设计了历史网格图,以动态聚合视觉特征到结构化的空间记忆中,以增强全面的场景意识。此外,手动细化了CityNav数据集的注释以提高数据质量。在细化后的CityNav数据集上的实验表明,HETT实现了显著的性能提升,而大量消融研究进一步验证了每个组件的有效性。

关键词

引用

@article{arxiv.2512.14222,
  title  = {History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation},
  author = {Xichen Ding and Jianzhe Gao and Cong Pan and Wenguan Wang and Jie Qin},
  journal= {arXiv preprint arXiv:2512.14222},
  year   = {2025}
}