中文

从场景图像中进行无监督的物件级表示学习

计算机视觉与模式识别 2021-12-06 v2

摘要

对比自监督学习已在很大程度上缩小了在 ImageNet 上与有监督预训练的差距。然而,其成功高度依赖于 ImageNet 的以物件为中心的先验,即同一图像的不同增强视图对应于同一物件。当在包含许多物件的更复杂场景图像上预训练时,这种高度筛选的约束立即变得不可行。为克服此限制,我们引入物件级表示学习(ORL),一种面向场景图像的新的自监督学习框架。我们的核心见解是利用图像级自监督预训练作为先验来发现物件级语义对应,从而实现从场景图像中进行物件级表示学习。在 COCO 上的大量实验表明,ORL 显著提升了场景图像上自监督学习的性能,甚至在若干下游任务上超越了有监督 ImageNet 预训练。此外,当有更多无标注场景图像可用时,ORL 提升了下游性能,展示了其利用野外无标注数据的巨大潜力。我们希望我们的方法能激励未来关于从场景数据中进行更通用目的的无监督表示学习的研究。

关键词

引用

@article{arxiv.2106.11952,
  title  = {Unsupervised Object-Level Representation Learning from Scene Images},
  author = {Jiahao Xie and Xiaohang Zhan and Ziwei Liu and Yew Soon Ong and Chen Change Loy},
  journal= {arXiv preprint arXiv:2106.11952},
  year   = {2021}
}

备注

NeurIPS 2021. Project page: https://www.mmlab-ntu.com/project/orl/ Code: https://github.com/Jiahao000/ORL