中文

CityGuessr: 全球尺度的城市级视频地理定位

计算机视觉与模式识别 2024-11-12 v1

摘要

视频地理定位是当前一个至关重要的问题。给定一段视频,确定其拍摄地点可以带来诸多优势。全球地理定位问题此前已有研究,但仅使用图像模态。其视频对应方法仍相对未被充分探索。与此同时,视频地理定位在近期也受到了一些关注,但现有方法均局限于特定区域。这促使我们探索全球尺度的视频地理定位问题。因此,我们提出了一个全球视频地理定位的新问题,目标是给定一段视频,层次化地预测正确的城市、省/州、国家和大洲。然而,不存在覆盖全球的大规模视频数据集来训练解决此问题的模型。为此,我们引入了一个新数据集 CityGuessr68k,包含来自全球 166 个城市的 68,269 个视频。我们还通过设计一个基于 Transformer 的架构提出了该问题的新基线方法,该架构包含一个优雅的自交叉注意力模块用于融合场景信息,以及一种特征空间中的文本标签对齐策略用于从文本标签中蒸馏知识。为进一步提升位置预测,我们还利用了软场景标签。最后,我们在新建数据集以及 Mapillary (MSLS) 上展示了方法的性能。代码和数据集可在 https://github.com/ParthPK/CityGuessr 获取。

关键词

引用

@article{arxiv.2411.06344,
  title  = {CityGuessr: City-Level Video Geo-Localization on a Global Scale},
  author = {Parth Parag Kulkarni and Gaurav Kumar Nayak and Mubarak Shah},
  journal= {arXiv preprint arXiv:2411.06344},
  year   = {2024}
}

备注

Accepted to ECVA Eurpoean Conference on Computer Vision(ECCV) 2024