中文

基于负短语增强的开放词汇目标检索与定位的判别学习

计算机视觉与模式识别 2018-09-05 v2

摘要

得益于目标检测技术的成功,我们甚至可以从海量图像集合中检索出指定类别的物体。然而,当前最先进的目标检测器(如 Faster R-CNN)只能处理预先指定的类别,且训练需要大量正负视觉样本。本文研究开放词汇目标检索与定位问题,其中目标物体由文本查询(如单词或短语)指定。我们首先提出 Query-Adaptive R-CNN,作为 Faster R-CNN 面向开放词汇查询的简单扩展,通过将文本嵌入向量转换为目标分类器和定位回归器来实现。然后,为进行判别训练,我们提出负短语增强(NPA)来挖掘在视觉上与查询相似、同时在语义上与查询互斥的困难负样本。所提方法可在仅 0.5 秒内从一百万张图像中高精度地检索并定位由文本查询指定的物体。

关键词

引用

@article{arxiv.1711.09509,
  title  = {Discriminative Learning of Open-Vocabulary Object Retrieval and Localization by Negative Phrase Augmentation},
  author = {Ryota Hinami and Shin'ichi Satoh},
  journal= {arXiv preprint arXiv:1711.09509},
  year   = {2018}
}

备注

Accepted to EMNLP 2018