中文

UniVIP:一种自监督视觉预训练的统一框架

计算机视觉与模式识别 2022-03-15 v1

摘要

自监督学习(SSL)有望利用大量无标注数据。然而,主流 SSL 方法的成功仅限于 ImageNet 等单中心物体图像,忽视了场景与实例之间的关联,以及场景中实例的语义差异。为解决上述问题,我们提出统一自监督视觉预训练(UniVIP),一种新颖的自监督框架,用于在单中心物体或非标志性数据集上学习通用视觉表征。该框架考虑了三个层次的表征学习:1)场景-场景的相似性,2)场景-实例的关联性,3)实例-实例的判别性。在学习过程中,我们采用最优传输算法自动度量实例的判别性。大量实验表明,在非标志性 COCO 上预训练的 UniVIP 在图像分类、半监督学习、目标检测与分割等多种下游任务上取得了最先进的迁移性能。此外,我们的方法也能利用 ImageNet 等单中心物体数据集,在线性探测中以相同预训练轮数超越 BYOL 达 2.5%,并在 COCO 数据集上超越当前的自监督目标检测方法,展现了其通用性与潜力。

关键词

引用

@article{arxiv.2203.06965,
  title  = {UniVIP: A Unified Framework for Self-Supervised Visual Pre-training},
  author = {Zhaowen Li and Yousong Zhu and Fan Yang and Wei Li and Chaoyang Zhao and Yingying Chen and Zhiyang Chen and Jiahao Xie and Liwei Wu and Rui Zhao and Ming Tang and Jinqiao Wang},
  journal= {arXiv preprint arXiv:2203.06965},
  year   = {2022}
}

备注

Accepted by CVPR2022