中文

如同测试般过滤:基于数据驱动的 CLIP 预训练数据过滤

计算机视觉与模式识别 2025-11-27 v3 机器学习

摘要

我们提出 Filter Like You Test (FLYT),一种用于筛选大规模视觉语言数据集的算法,通过学习每个数据点作为预训练样本的有用性来实现。FLYT 通过在下游任务训练集上获取的梯度信号训练评分模型,学习为每个样本的特征赋予权重。基于 FLYT,我们实现了混合-FLYT (M-FLYT),将不同评分方法生成的每个样本得分作为特征,并学习将其统一为单个得分。FLYT 自然为训练样本分布生成概率分布,我们通过软上限抽样 (SCS) 策略利用这一点,该策略从每个样本的概率中抽取样本,以防止过度代表。通过这些方法,我们在 DataComp 中等规模过滤基准上实现了 40.1% 的 ImageNet zero-shot accuracy,这是对所有前期结果的 2% 绝对精度提升,以及使用仅公共资源的结果的 5.5% 提升。我们的 approach 还在 38 个 DataComp 评估任务的平均值上取得 37.7%,超越了使用公共资源的前期方法 0.4%。

关键词

引用

@article{arxiv.2503.08805,
  title  = {Filter Like You Test: Data-Driven Data Filtering for CLIP Pretraining},
  author = {Mikey Shechter and Yair Carmon},
  journal= {arXiv preprint arXiv:2503.08805},
  year   = {2025}
}