中文

LeOCLR:利用原始图像进行视觉表征的对比学习

计算机视觉与模式识别 2025-04-21 v4

摘要

对比实例判别方法在图像分类和目标检测等下游任务中优于监督学习。然而,这些方法在表征学习过程中严重依赖数据增强,若实施不当可能导致次优结果。对比学习中一种常见的增强技术是随机裁剪后调整大小。当两次随机裁剪包含不同的语义内容时,这会降低表征学习的质量。为解决这一问题,我们提出了 LeOCLR(Leveraging Original Images for Contrastive Learning of Visual Representations),该框架采用了一种新颖的实例判别方法和适配的损失函数。该方法防止了在表征学习过程中因映射不同物体部分而导致的重要语义特征丢失。我们的实验表明,LeOCLR 在各种数据集上 consistently 提升了表征学习效果,优于基线模型。例如,在线性评估中,LeOCLR 在 ImageNet-1K 上的表现比 MoCo-v2 高出 5.1%,并在迁移学习和目标检测任务上优于其他几种方法。

关键词

引用

@article{arxiv.2403.06813,
  title  = {LeOCLR: Leveraging Original Images for Contrastive Learning of Visual Representations},
  author = {Mohammad Alkhalefi and Georgios Leontidis and Mingjun Zhong},
  journal= {arXiv preprint arXiv:2403.06813},
  year   = {2025}
}

备注

15 pages, 5 figures, 9 tables - accepted at TMLR 10/2024; V4 corrected some typos in the references