中文

GOMAA-Geo: 目标模态无关的主动地理定位

计算机视觉与模式识别 2024-06-05 v1 人工智能

摘要

我们考虑主动地理定位(AGL)任务,在该任务中,智能体利用在空中导航期间观察到的一系列视觉线索来寻找通过多种可能模态指定的目标。这可以模拟一架参与搜救行动的无人机在某个区域导航并沿途观察一系列航空图像的过程。AGL任务面临两个重要挑战。首先,智能体必须处理某一种模态的目标规范(例如,通过自然语言描述),而搜索线索则以其他模态(航空图像)提供。第二个挑战是有限的定位时间(例如,有限的电池寿命、紧急情况),因此必须尽可能高效地定位目标,即智能体在搜索目标时必须有效利用其顺序观察到的空中视图。为了应对这些挑战,我们提出了GOMAA-Geo——一种目标模态无关的主动地理定位智能体——以实现不同目标模态之间的零样本泛化。我们的方法结合了跨模态对比学习以对齐跨模态的表示,以及有监督的基础模型预训练和强化学习,以获得高效的导航和定位策略。通过广泛的评估,我们表明GOMAA-Geo优于其他可学习的替代方法,并且它能够跨数据集泛化(例如,泛化到受灾区域,尽管在训练期间未见过任何灾难场景)以及跨目标模态泛化(例如,泛化到地面图像或文本描述,尽管仅在训练时使用以空中视图指定的目标)。代码和模型已在 https://github.com/mvrl/GOMAA-Geo/tree/main 公开。

关键词

引用

@article{arxiv.2406.01917,
  title  = {GOMAA-Geo: GOal Modality Agnostic Active Geo-localization},
  author = {Anindya Sarkar and Srikumar Sastry and Aleksis Pirinen and Chongjie Zhang and Nathan Jacobs and Yevgeniy Vorobeychik},
  journal= {arXiv preprint arXiv:2406.01917},
  year   = {2024}
}

备注

23 pages, 17 figures