中文

播种视图:用于对比表示学习的层次化语义对齐

计算机视觉与模式识别 2021-04-08 v2

摘要

基于实例判别的自监督学习已展现出显著进展。特别是,将每幅图像及其增强视为一个独立类别并试图将其与所有其他图像区分开的对比学习,已被证实对表示学习有效。然而,将两幅事实上相似的图像推远对于通用表示而言是次优的。本文中,我们提出一种层次化语义对齐策略,通过将单幅图像生成的视图扩展到跨样本与多层次表示,并以层次化方式对语义相似图像的不变性建模。这是通过将对比损失扩展为允许每个锚点有多个正样本,并在网络的不同层显式地将语义相似的图像/块拉近来实现的。我们称该方法为 CsMl,它能够以鲁棒方式跨样本整合多层次视觉表示。CsMl 适用于当前基于对比学习的方法,并一致地提升性能。值得注意的是,以 MoCo 作为实例化,CsMl 在使用 ResNet-50 为骨干的线性评估中取得了 76.6\% 的 top-1 准确率,以及在仅使用 1\% 和 10\% 标签时分别取得 66.7\% 和 75.1\% 的 top-1 准确率。所有这些数字均刷新了当前最优(SOTA)。

关键词

引用

@article{arxiv.2012.02733,
  title  = {Seed the Views: Hierarchical Semantic Alignment for Contrastive Representation Learning},
  author = {Haohang Xu and Xiaopeng Zhang and Hao Li and Lingxi Xie and Hongkai Xiong and Qi Tian},
  journal= {arXiv preprint arXiv:2012.02733},
  year   = {2021}
}