G^3:通过指南书对齐进行地理定位
计算机视觉与模式识别
2022-11-29 v1 计算与语言
摘要
我们展示了语言如何改进地理定位:即预测图像拍摄位置的任务。我们在此研究来自人类编写的指南书中的显式知识,这些指南书描述了人类用于地理定位的显著且具有类别区分性的视觉特征。我们提出了通过指南书对齐进行地理定位的任务,该任务使用来自不同地点的街景图像数据集以及流行互动地理定位游戏 GeoGuessr 的关联文本指南书。我们的方法通过关注从指南书中自动提取的线索来预测每张图像的国家。使用国家级的伪标签监督注意力机制取得了最佳性能。我们的方法显著优于最先进的仅基于图像的地理定位方法,Top-1 准确率提高了超过 5%。我们的数据集和代码可在 https://github.com/g-luo/geolocation_via_guidebook_grounding 找到。
引用
@article{arxiv.2211.15521,
title = {G^3: Geolocation via Guidebook Grounding},
author = {Grace Luo and Giscard Biamby and Trevor Darrell and Daniel Fried and Anna Rohrbach},
journal= {arXiv preprint arXiv:2211.15521},
year = {2022}
}
备注
Findings of EMNLP 2022