中文

数据过滤的缩放定律——数据筛选不能脱离计算算力

机器学习 2024-04-11 v1

摘要

视觉-语言模型(VLMs)在精心筛选的网络数据集上接受数千 GPU 小时的训练。近来,数据筛选日益受到重视,多项研究开发了保留“原始”抓取数据中“高质量”子集的策略。例如,LAION 公共数据集仅保留了总抓取数据的 10%。然而,这些策略通常在制定时脱离了可用于训练的算力。在本文中,我们首先证明独立于训练算力进行过滤决策往往是次优的:有限的高质量数据在重复使用时会迅速失去其效用,最终需要纳入“未见”但“质量较低”的数据。为了解决这种质量-数量权衡(QQT\texttt{QQT}),我们引入了考虑网络数据非均匀性质的神经缩放定律,这是现有文献中忽略的角度。我们的缩放定律(i)表征了网络数据各质量子集的不同\textit{不同}“效用”;(ii)考虑了数据点在其第“n”次重复时效用如何衰减;以及(iii)阐述了组合时各数据池的相互作用,从而能够在无需联合训练的情况下估算模型在多个数据池组合上的性能。我们的核心信息是,数据筛选不能\textit{不能}脱离模型训练的总算力。我们的缩放定律使我们能够在各种算力预算下筛选出最佳数据池,以在 Datacomp 上实现顶尖性能,为数据筛选划定了一条帕累托前沿。代码可在 https://github.com/locuslab/scaling_laws_data_filtering 获取。

关键词

引用

@article{arxiv.2404.07177,
  title  = {Scaling Laws for Data Filtering -- Data Curation cannot be Compute Agnostic},
  author = {Sachin Goyal and Pratyush Maini and Zachary C. Lipton and Aditi Raghunathan and J. Zico Kolter},
  journal= {arXiv preprint arXiv:2404.07177},
  year   = {2024}
}

备注

Published at CVPR 2024