中文

Google Landmarks Dataset v2 —— 面向实例级识别与检索的大规模基准

计算机视觉与模式识别 2020-11-03 v2

摘要

尽管图像检索和实例识别技术进展迅速,但仍需要具有挑战性的数据集来准确衡量其性能,同时提出与实际应用相关的新挑战。我们引入了 Google Landmarks Dataset v2(GLDv2),这是一个在人造和自然地标领域用于大规模、细粒度实例识别和图像检索的新基准。GLDv2 以巨大优势成为迄今为止此类最大的数据集,包含超过 500 万张图像和 20 万个不同的实例标签。其测试集由 11.8 万张图像组成,带有用于检索和识别任务的真值标注。真值构建涉及超过 800 小时的人工标注工作。我们的新数据集具有受现实世界应用启发的几个具有挑战性的属性,这些属性是先前数据集未考虑的:极长尾的类别分布、大量域外测试照片以及较大的类内差异。该数据集来源于 Wikimedia Commons,这是世界上最大的众包地标照片集。我们提供了基于 SOTA 方法的识别和检索任务的基线结果,以及来自公开竞赛的竞争性结果。我们进一步展示了该数据集在迁移学习中的适用性,表明在其上训练的图像嵌入在独立数据集上实现了具有竞争力的检索性能。数据集图像、真值和度量评分代码可在 https://github.com/cvdfoundation/google-landmark 获取。

关键词

引用

@article{arxiv.2004.01804,
  title  = {Google Landmarks Dataset v2 -- A Large-Scale Benchmark for Instance-Level Recognition and Retrieval},
  author = {Tobias Weyand and Andre Araujo and Bingyi Cao and Jack Sim},
  journal= {arXiv preprint arXiv:2004.01804},
  year   = {2020}
}

备注

CVPR20 camera-ready (oral) + appendices