中文

块级自监督视觉表征学习:一种细粒度方法

计算机视觉与模式识别 2025-04-08 v5

摘要

自监督视觉表征学习传统上聚焦于图像级实例判别。我们的研究通过将这些方法学与块级判别相融合,引入了一种创新的细粒度维度。该融合使得局部与全局视觉特征得以同步分析,从而丰富了所学表征的质量。首先,原始图像经历空间增强。随后,我们采用一种独特的光度块级增强,其中每个图像块被独立增强,与同一视图中的其他块无关。该方法生成了在各分段具有显著色彩差异的多样化训练数据集。增强后的图像继而通过以 Vision Transformer (ViT) 为骨干的自蒸馏学习框架进行处理。所提方法在图像与块两个层级上最小化表征距离,以捕捉从宏观到微观的细节。为此,我们提出了一种简洁而高效的块匹配算法,用于寻找增强视图间的对应块。得益于该块匹配算法的高效结构,我们的方法相较同类方法降低了计算复杂度。因而,我们在不显著增加计算需求的前提下实现了对模型的深入理解。我们已在 Cifar10、ImageNet-100 与 ImageNet-1K 等多种规模的数据集上广泛预训练本方法。其在图像分类及复制检测、图像检索等下游任务中,较最先进的自监督表征学习方法展现出更优性能。我们的方法实现已发布于 GitHub。

关键词

引用

@article{arxiv.2310.18651,
  title  = {Patch-Wise Self-Supervised Visual Representation Learning: A Fine-Grained Approach},
  author = {Ali Javidani and Mohammad Amin Sadeghi and Babak Nadjar Araabi},
  journal= {arXiv preprint arXiv:2310.18651},
  year   = {2025}
}

备注

15 pages