面向对比学习的实例间相似性建模
计算机视觉与模式识别
2023-06-30 v3
摘要
现有对比学习方法广泛采用独热实例判别作为自监督学习的 pretext 任务,这不可避免地忽略了自然图像间丰富的实例间相似性,进而导致潜在的表征退化。本文中,我们提出一种新颖的图像混合方法 PatchMix,用于 Vision Transformer(ViT)中的对比学习,以建模图像间的实例间相似性。遵循 ViT 的特性,我们在块级别随机混合小批量中的多张图像,为 ViT 构建混合图像块序列。与现有样本混合方法相比,我们的 PatchMix 能够灵活高效地混合两张以上图像,并模拟自然图像间更复杂的相似性关系。以此方式,我们的对比框架可显著缩小对比目标与真实情况之间的差距。实验结果表明,我们所提方法在 ImageNet-1K 与 CIFAR 数据集上均显著优于先前最先进方法,例如在 ImageNet-1K 上线性准确率提升 3.0%,在 CIFAR100 上 kNN 准确率提升 8.7%。此外,我们的方法在下游任务(COCO 数据集上的目标检测与实例分割)上取得了领先的迁移性能。代码见 https://github.com/visresearch/patchmix
引用
@article{arxiv.2306.12243,
title = {Inter-Instance Similarity Modeling for Contrastive Learning},
author = {Chengchao Shen and Dawei Liu and Hao Tang and Zhe Qu and Jianxin Wang},
journal= {arXiv preprint arXiv:2306.12243},
year = {2023}
}