中文

迈向对比自监督学习的泛化理解

机器学习 2023-03-03 v4 人工智能 计算机视觉与模式识别 机器学习

摘要

近年来,自监督学习备受关注,因为它仅需无标签数据即可进行模型训练。对比学习是自监督学习的一种流行方法,并已取得令人瞩目的经验性能。然而,对其泛化能力的理论理解仍然有限。为此,我们定义了一种(σ,δ)(\sigma,\delta)-测度来从数学上量化数据增强,并基于该测度给出了下游分类错误率的上界。这表明对比自监督学习的泛化能力与三个关键因素相关:正样本的对齐、类中心的发散以及增强数据的集中性。前两个因素是所学表示的性质,而第三个由预定义的数据增强决定。我们进一步研究了两种典型对比损失InfoNCE和交叉相关,以展示它们如何可证明地实现前两个因素。此外,我们进行了实验来研究第三个因素,并观察到下游性能与增强数据集中性之间的强相关性。

关键词

引用

@article{arxiv.2111.00743,
  title  = {Towards the Generalization of Contrastive Self-Supervised Learning},
  author = {Weiran Huang and Mingyang Yi and Xuyang Zhao and Zihao Jiang},
  journal= {arXiv preprint arXiv:2111.00743},
  year   = {2023}
}

备注

Accepted by ICLR 2023