中文

细节决定成败:深入数据过滤的迷局

计算机视觉与模式识别 2023-09-29 v1 机器学习

摘要

预训练数据的质量在基础模型性能中起着关键作用。流行的基础模型常设计自有数据过滤方案,难以分析与比较不同数据过滤方法。DataComp 是一个致力于评估不同数据过滤方法的新基准。本文描述了我们参与 DataComp 挑战赛时的经验与方案。我们的过滤策略包括三阶段:单模态过滤、跨模态过滤与数据分布对齐。我们整合现有方法并提出新方案,例如在水平翻转图像上计算 CLIP 分数以减轻场景文本干扰,使用视觉与语言模型为下游目标任务检索训练样本,重新平衡数据分布以提升计算预算分配效率等。我们细致剖析设计选择,提供深入分析,并讨论开放问题。我们的方法在 38 个任务的平均性能上超越 DataComp 论文最佳方法逾 4%,在 ImageNet 上超越逾 2%。

关键词

引用

@article{arxiv.2309.15954,
  title  = {The Devil is in the Details: A Deep Dive into the Rabbit Hole of Data Filtering},
  author = {Haichao Yu and Yu Tian and Sateesh Kumar and Linjie Yang and Heng Wang},
  journal= {arXiv preprint arXiv:2309.15954},
  year   = {2023}
}

备注

12 pages, 10 figures