中文

捉迷藏:迫使网络在弱监督物体与动作定位中做到细致入微

计算机视觉与模式识别 2017-12-27 v2

摘要

我们提出了“捉迷藏”(Hide-and-Seek),这是一种旨在改进图像中物体定位和视频中动作定位的弱监督框架。大多数现有的弱监督方法仅定位物体最具判别力的部分而非所有相关部分,从而导致性能次优。我们的核心思想是随机隐藏训练图像中的图块,迫使网络在最具有判别力的部分被隐藏时去寻找其他相关部分。我们的方法只需修改输入图像,并可与任何设计用于物体定位的网络配合使用。在测试期间,我们不需要隐藏任何图块。我们的“捉迷藏”方法在 ILSVRC 数据集上的弱监督物体定位任务中获得了优于以往方法的性能。我们还证明了我们的框架可以轻松扩展到弱监督动作定位。

关键词

引用

@article{arxiv.1704.04232,
  title  = {Hide-and-Seek: Forcing a Network to be Meticulous for Weakly-supervised Object and Action Localization},
  author = {Krishna Kumar Singh and Yong Jae Lee},
  journal= {arXiv preprint arXiv:1704.04232},
  year   = {2017}
}

备注

Camera-Ready Version (ICCV 2017)