中文

Detect-to-Retrieve:面向图像检索的高效区域聚合

计算机视觉与模式识别 2019-05-15 v2

摘要

在杂乱场景中高效检索目标实例需要紧凑而全面的图像区域表示。直观上,目标语义有助于构建聚焦于最相关区域的索引。然而,由于检索基准中缺乏感兴趣目标的边界框数据集,近期关于区域表示的工作大多集中于均匀或类别无关的区域选择。本文首先填补了这一空白,基于 Google Landmarks 数据集提供了一个新的地标边界框数据集,包含来自 15k 个独特地标的 86k 张带人工标注框的图像。随后,我们展示了如何利用使用新数据集训练的地标检测器来索引图像区域,并在比现有区域方法高效得多的同时提升检索精度。此外,我们引入了一种新颖的区域聚合选择性匹配核(R-ASMK),以将检测区域的信息有效结合为改进的整体图像表示。R-ASMK 在不增加维度的前提下大幅提升了图像检索精度,甚至优于独立索引图像区域的系统。我们完整的图像检索系统在 Revisited Oxford 和 Paris 数据集上显著优于先前的最优方法(SOTA)。代码与数据见项目主页:https://github.com/tensorflow/models/tree/master/research/delf。

关键词

引用

@article{arxiv.1812.01584,
  title  = {Detect-to-Retrieve: Efficient Regional Aggregation for Image Search},
  author = {Marvin Teichmann and Andre Araujo and Menglong Zhu and Jack Sim},
  journal= {arXiv preprint arXiv:1812.01584},
  year   = {2019}
}

备注

CVPR 2019. Code and dataset available: https://github.com/tensorflow/models/tree/master/research/delf