迈向对比自监督学习的泛化理解
机器学习
2023-03-03 v4 人工智能
计算机视觉与模式识别
机器学习
摘要
近年来,自监督学习备受关注,因为它仅需无标签数据即可进行模型训练。对比学习是自监督学习的一种流行方法,并已取得令人瞩目的经验性能。然而,对其泛化能力的理论理解仍然有限。为此,我们定义了一种-测度来从数学上量化数据增强,并基于该测度给出了下游分类错误率的上界。这表明对比自监督学习的泛化能力与三个关键因素相关:正样本的对齐、类中心的发散以及增强数据的集中性。前两个因素是所学表示的性质,而第三个由预定义的数据增强决定。我们进一步研究了两种典型对比损失InfoNCE和交叉相关,以展示它们如何可证明地实现前两个因素。此外,我们进行了实验来研究第三个因素,并观察到下游性能与增强数据集中性之间的强相关性。
引用
@article{arxiv.2111.00743,
title = {Towards the Generalization of Contrastive Self-Supervised Learning},
author = {Weiran Huang and Mingyang Yi and Xuyang Zhao and Zihao Jiang},
journal= {arXiv preprint arXiv:2111.00743},
year = {2023}
}
备注
Accepted by ICLR 2023