GPS-SSL:引导正采样将先验知识注入自监督学习
计算机视觉与模式识别
2024-01-10 v2 人工智能
机器学习
摘要
我们提出了引导正采样自监督学习(GPS-SSL),这是一种将先验知识注入自监督学习(SSL)正样本选择的通用方法。当前的SSL方法利用数据增强(DA)生成正样本,并融入先验知识——不正确或过弱的DA会大幅降低所学表示的质量。GPS-SSL则提出设计一个度量空间,其中欧几里得距离成为语义关系的有意义代理。在该空间中,可以通过最近邻采样生成正样本。任何先验知识现在都可以独立于所使用的DA嵌入到该度量空间中。由于其简单性,GPS-SSL适用于任何SSL方法,例如SimCLR或BYOL。GPS-SSL的一个关键优势在于减轻了定制强DA的压力。例如,在使用弱DA时,GPS-SSL在Cifar10上达到85.58%,而基线仅达到37.51%。因此,我们朝着使SSL减少对DA依赖的目标迈出了一步。我们还表明,即使使用强DA,GPS-SSL在尚未充分研究的领域上也优于基线。我们在模型使用强或最小数据增强的情况下,在来自不同领域的多个下游数据集上评估了GPS-SSL以及多种基线SSL方法。我们希望GPS-SSL将为研究如何以原则性的方式将先验知识注入SSL开辟新途径。
引用
@article{arxiv.2401.01990,
title = {GPS-SSL: Guided Positive Sampling to Inject Prior Into Self-Supervised Learning},
author = {Aarash Feizi and Randall Balestriero and Adriana Romero-Soriano and Reihaneh Rabbany},
journal= {arXiv preprint arXiv:2401.01990},
year = {2024}
}