数据过滤网络
人工智能
2023-11-07 v3 机器学习
摘要
大型训练集已成为机器学习的基石,也是近期语言建模与多模态学习进展的基础。尽管预训练的数据整理通常仍是临时性的,一个常见范式是首先从 Web 收集海量数据池,然后通过各种启发式方法将该候选池过滤为实际训练集。在本工作中,我们研究为这一第二步——过滤大型未整理数据集——学习数据过滤网络(DFN)的问题。我们的关键发现是:用于过滤的网络的质量不同于其在下游任务上的性能:例如,在 ImageNet 上表现良好的模型可能比一个在 ImageNet 上准确率较低但在少量高质量数据上训练的模型产生更差的训练集。基于我们的见解,我们构建了新颖的数据过滤网络,其导出了最先进的图像-文本数据集。具体而言,我们性能最佳的数据集 DFN-5B 使我们能够为其计算预算训练最先进的 CLIP 模型:除在多种任务上的其他改进外,在我们的数据集上训练的 ViT-H 在 ImageNet 上实现了 84.4% 的零样本迁移准确率,优于在其他数据集(如 LAION-2B、DataComp-1B 或 OpenAI 的 WIT)上训练的模型。为促进数据集设计的进一步研究,我们还发布了一个新的 20 亿样本数据集 DFN-2B,并展示了高性能数据过滤网络可以仅使用公开可用数据从零开始训练。
引用
@article{arxiv.2309.17425,
title = {Data Filtering Networks},
author = {Alex Fang and Albin Madappally Jose and Amit Jain and Ludwig Schmidt and Alexander Toshev and Vaishaal Shankar},
journal= {arXiv preprint arXiv:2309.17425},
year = {2023}
}