中文

SCAN:为数据效率引导对比预训练

计算机视觉与模式识别 2024-11-15 v1

摘要

虽然对比预训练被广泛采用,但其数据效率问题迄今相对鲜有探索。现有方法常依赖静态核心集选择算法预先识别用于训练的重要数据。然而,这种静态特性使其无法在预训练过程中动态追踪数据的有用性,导致预训练模型表现不佳。为应对这一挑战,本文提出了一种新颖的动态引导数据集剪枝方法。它涉及剪枝数据准备后的数据集变异操作,两者均经历迭代和动态更新。我们将该方法应用于两种流行的对比预训练框架:CLIP 和 MoCo,分别代表视觉-语言和以视觉为中心的领域。具体而言,我们在两个大规模图文对数据集上分别预训练了七个 CLIP 模型,在 ImageNet 数据集上预训练了两个 MoCo 模型,共得到 16 个预训练模型。在所有 16 个模型中,以 30-35% 的数据剪枝率,与在完整数据集上训练的对应模型相比,我们的方法在各种下游数据集上仅表现出边际性能下降(平均小于 1%),且以较大优势超越了多个基线。此外,我们方法的副产品——即预训练后从原始数据集衍生出的核心集——在下游性能方面也显示出相对于其他静态核心集选择方法的显著优越性。

关键词

引用

@article{arxiv.2411.09126,
  title  = {SCAN: Bootstrapping Contrastive Pre-training for Data Efficiency},
  author = {Yangyang Guo and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:2411.09126},
  year   = {2024}
}