中文

面向空中视觉与对话导航的目标接地图感知Transformer

计算机视觉与模式识别 2023-12-15 v5

摘要

本报告详述了 ICCV CLVL 2023 中 AVDN 挑战赛获胜方案的方法。该竞赛针对从对话历史进行空中导航(ANDH)任务,要求无人机智能体将对话历史与空中观测相关联以抵达目的地。为增强无人机智能体的跨模态接地能力,我们提出了一种目标接地图感知Transformer(TG-GAT)框架。具体而言,TG-GAT 首先利用图感知Transformer捕获时空依赖关系,这有助于导航状态跟踪与鲁棒动作规划。此外,设计了一个辅助视觉接地任务以提升智能体对被提及地标的感知。进而,采用基于大语言模型的混合增强策略以缓解数据稀缺限制。我们的 TG-GAT 框架赢得了 AVDN 挑战赛,在 SPL 和 SR 指标上分别较基线取得 2.2% 和 3.0% 的绝对提升。代码见 https://github.com/yifeisu/TG-GAT。

关键词

引用

@article{arxiv.2308.11561,
  title  = {Target-Grounded Graph-Aware Transformer for Aerial Vision-and-Dialog Navigation},
  author = {Yifei Su and Dong An and Yuan Xu and Kehan Chen and Yan Huang},
  journal= {arXiv preprint arXiv:2308.11561},
  year   = {2023}
}

备注

1st Place Solution for the AVDN Challenge in ICCV CLVL 2023