中文

面向零样本目标检测的未见过对象视觉特征合成

计算机视觉与模式识别 2020-10-20 v1

摘要

现有零样本检测方法将可见对象的视觉特征投影到语义域,期望在推理时将未见过对象映射到其相应语义。然而,由于未见过对象在训练中从未被可视化,检测模型偏向可见内容,从而将未见过对象标为背景或某个可见类别。本工作中,我们提出为未见类别合成视觉特征,使模型在视觉域中学习可见与未见对象。由此,主要挑战变为如何仅利用类别语义准确合成未见对象。针对这一雄心目标,我们提出一种新颖生成模型,利用类别语义不仅生成特征且具判别性地分离它们。进一步,借助统一模型,我们确保合成特征具有高多样性以表征类内差异及检测边界框中可变的定位精度。我们在 PASCAL VOC、MSCOCO 与 ILSVRC detection 三个目标检测基准上,于常规与广义设定下测试了方法,显示出相较 SOTA 方法的显著提升。我们的代码见 https://github.com/nasir6/zero_shot_detection。

关键词

引用

@article{arxiv.2010.09425,
  title  = {Synthesizing the Unseen for Zero-shot Object Detection},
  author = {Nasir Hayat and Munawar Hayat and Shafin Rahman and Salman Khan and Syed Waqas Zamir and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2010.09425},
  year   = {2020}
}

备注

Accepted for publication at ACCV 2020