中文

Mugs:一种多粒度自监督学习框架

计算机视觉与模式识别 2022-03-29 v1 人工智能

摘要

在自监督学习中,多粒度特征备受青睐却鲜有研究,因为不同的下游任务(例如通用与细粒度分类)常需要不同或多粒度特征,例如细粒度或粗粒度特征或其混合。本工作中,我们首次提出一种有效的多粒度自监督学习(Mugs)框架,以显式学习多粒度视觉特征。Mugs 具有三种互补的粒度监督:1)实例判别监督(IDS),2)一种新颖的局部组判别监督(LGDS),以及 3)组判别监督(GDS)。IDS 区分不同实例以学习实例级细粒度特征。LGDS 将一幅图像及其邻域的特征聚为局部组特征,并将同一图像不同裁剪的局部组特征拉近、对其他图像的局部组特征推远。它通过在对局部邻域的额外对齐上补充 IDS 的实例监督,并将不同局部组分开以提升可判别性。据此,它有助于在局部组级别学习高级细粒度特征。最后,为防止相似局部组被随机或远距离分散,GDS 将相似样本拉近从而将相似局部组聚拢,在(语义)组级别捕捉粗粒度特征。因此,Mugs 可捕捉三种粒度特征,相较于单粒度特征(例如对比学习中的实例级细粒度特征)常在多样下游任务上具备更高通用性。仅在 ImageNet-1K 上预训练,Mugs 在 ImageNet-1K 上创下 82.1%\% 的 SoTA 线性探测精度,并将先前 SoTA 提升 1.1%1.1\%。它还在其他任务(例如迁移学习、检测与分割)上超越 SoTA。

关键词

引用

@article{arxiv.2203.14415,
  title  = {Mugs: A Multi-Granular Self-Supervised Learning Framework},
  author = {Pan Zhou and Yichen Zhou and Chenyang Si and Weihao Yu and Teck Khim Ng and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2203.14415},
  year   = {2022}
}

备注

code and models are available at https://github.com/sail-sg/mugs