中文

OBoW:用于自监督学习的在线视觉词袋生成

计算机视觉与模式识别 2021-11-01 v2 机器学习

摘要

在无人类监督下学习图像表示是一个重要且活跃的研究领域。近期的若干方法成功利用了使此类表示在不同类型扰动下保持不变的思想,尤其是通过基于对比的实例判别训练。尽管有效的视觉表示确实应展现此类不变性,但还存在其他重要特性,例如编码上下文推理能力,对此基于重构的替代方法可能更为适合。鉴于此,我们提出一种师生方案,通过训练一个卷积网络来重构图像的视觉词袋(BoW)表示,其输入为该图像的扰动版本。我们的策略对教师网络(负责生成BoW目标)、学生网络(负责学习表示)进行在线训练,并对视觉词词汇表(用于BoW目标)进行在线更新。该思想有效实现了完全在线的BoW引导无监督学习。大量实验证明了我们基于BoW策略的价值,其在若干应用中超越了先前的state-of-the-art方法(包括基于对比的方法)。例如,在Pascal目标检测、Pascal分类和Places205分类等下游任务中,我们的方法优于所有先前的无监督方法,从而确立了新的state-of-the-art结果,甚至显著优于有监督预训练的结果。我们在 https://github.com/valeoai/obow 提供了实现代码。

关键词

引用

@article{arxiv.2012.11552,
  title  = {OBoW: Online Bag-of-Visual-Words Generation for Self-Supervised Learning},
  author = {Spyros Gidaris and Andrei Bursuc and Gilles Puy and Nikos Komodakis and Matthieu Cord and Patrick Pérez},
  journal= {arXiv preprint arXiv:2012.11552},
  year   = {2021}
}

备注

Accepted to CVPR2021. Code at https://github.com/valeoai/obow