利用语义正样本对增强实例判别方法的视觉表征学习
计算机视觉与模式识别
2025-05-01 v3 机器学习
摘要
基于实例判别的自监督学习算法(SSL)已展现出有前景的结果,在一些下游任务中表现具有竞争力甚至优于监督学习对应方法。此类方法采用数据增强来创建同一实例的两个视图(即正样本对),并鼓励模型在嵌入空间中拉近这些视图而不坍缩至平凡解,从而学习良好表征。然而,数据增强在表示正样本对方面存在局限,且对比学习过程中实例间的排斥可能丢弃具有相似类别的实例的重要特征。为解决此问题,我们提出一种方法,识别具有相似语义内容的图像并将其视为正实例,从而减少表征学习过程中丢弃重要特征的机会,并增加潜在表征的丰富性。我们的方法具有通用性,可作用于任何自监督实例判别框架,如 MoCo 与 SimSiam。为评估方法,我们在三个基准数据集 ImageNet、STL-10 与 CIFAR-10 上使用不同实例判别 SSL 方法运行实验。实验结果表明,我们的方法在所有三个数据集上一致优于基线方法;例如,在 ImageNet 上以线性评估协议训练 800 轮,我们将原始 MoCo-v2 提升了 4.1%。我们还报告了半监督学习、下游任务迁移学习及目标检测的结果。
引用
@article{arxiv.2306.16122,
title = {Semantic Positive Pairs for Enhancing Visual Representation Learning of Instance Discrimination Methods},
author = {Mohammad Alkhalefi and Georgios Leontidis and Mingjun Zhong},
journal= {arXiv preprint arXiv:2306.16122},
year = {2025}
}
备注
17 pages, 6 figures, 12 tables, V2: fixed typos in the references