中文

生成数据总是有助于对比学习吗?

机器学习 2024-03-20 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

对比学习(Contrastive Learning, CL)已成为无监督视觉表征学习最成功的范式之一,但它往往依赖于大量的人工数据增强。随着生成模型,特别是扩散模型的兴起,生成接近真实数据分布的逼真图像的能力已得到广泛认可。这些生成的高质量图像已被成功应用于增强对比表征学习,这种技术被称为“数据膨胀”。然而,我们发现生成的数据(即使来自像 DDPM 这样的优秀扩散模型)有时甚至可能损害对比学习。我们从数据膨胀和数据增强两个角度探究了这一失败背后的原因。我们首次揭示了更强的数据膨胀应伴随更弱的增强,反之亦然这一互补作用。我们还通过推导数据膨胀下的泛化界,为这些现象提供了严格的理论解释。基于这些见解,我们提出了自适应膨胀(Adaptive Inflation, AdaInf),这是一种纯粹以数据为中心的策略,不引入任何额外的计算成本。在基准数据集上,AdaInf 能为各种对比学习方法带来显著提升。值得注意的是,在不使用外部数据的情况下,AdaInf 在 CIFAR-10 上使用 SimCLR 获得了 94.70% 的线性分类准确率,创下了超越许多复杂方法的新纪录。代码可在 https://github.com/PKU-ML/adainf 获取。

关键词

引用

@article{arxiv.2403.12448,
  title  = {Do Generated Data Always Help Contrastive Learning?},
  author = {Yifei Wang and Jizhe Zhang and Yisen Wang},
  journal= {arXiv preprint arXiv:2403.12448},
  year   = {2024}
}

备注

19 pages. Accepted by ICLR 2024