中文

面向大规模半监督目标检测的视觉与语义知识迁移

计算机视觉与模式识别 2018-03-14 v2

摘要

基于深度 CNN 的目标检测系统已在多个大规模目标检测基准上取得显著成功。然而,训练此类检测器需要大量带标注的边界框,其比图像级标注更难获取。先前工作通过将图像级分类器转化为目标检测器来解决该问题。这是通过在对图像级和边界框标注均有的类别上建模二者差异,并将该信息迁移以将分类器转换为无边界框标注类别的检测器来实现的。我们改进了该先前工作,在迁移过程中融入来自视觉与语义领域的物体相似性知识。我们提出方法的直觉是:视觉与语义上相似的类别应比不相似类别展现出更多可迁移的共同属性,例如,将狗分类器与狗检测器之间的差异迁移到猫类上会得到更好的检测器,而非从小提琴类迁移。在具有挑战性的 ILSVRC2013 检测数据集上的实验结果表明,我们每个基于物体相似性的知识迁移方法均优于基线方法。我们发现了有力证据:视觉相似性与语义关联性在该任务中是互补的,且二者结合显著改善检测,在半监督设定下取得了最先进的检测性能。

关键词

引用

@article{arxiv.1801.03145,
  title  = {Visual and Semantic Knowledge Transfer for Large Scale Semi-supervised Object Detection},
  author = {Yuxing Tang and Josiah Wang and Xiaofang Wang and Boyang Gao and Emmanuel Dellandrea and Robert Gaizauskas and Liming Chen},
  journal= {arXiv preprint arXiv:1801.03145},
  year   = {2018}
}

备注

TPAMI. correct some typos