数字中的魔鬼:迈向鲁棒的多模态数据过滤
机器学习
2023-09-26 v1 计算机视觉与模式识别
摘要
为了在网页规模上恰当地过滤多模态数据集,采用合适的过滤方法以提升性能并降低训练成本变得至关重要。例如,LAION 论文采用 CLIP 分数过滤器来选取 CLIP 分数超过某一阈值的数据。另一方面,T-MARS 通过检测并掩码图像中的文本,再依据 CLIP 分数过滤,实现了高质量数据过滤。通过分析数据集,我们观察到文本内容中存在诸如数字之类的显著比例冗余信息。我们在数据子集上的实验揭示了这些冗余元素对 CLIP 分数的深远影响。一种合乎逻辑的方法是在消除这些影响后重新评估 CLIP 分数。实验上,我们的基于文本的 CLIP 过滤器在 DataComp(一个数据过滤基准)的“小规模”上于 ImageNet 分布偏移中优于排名最高的方法,取得了 3.6% 的性能提升。结果还表明,在选取前 40% 数据时,我们提出的文本掩码过滤器优于原始 CLIP 分数过滤器。数字对 CLIP 的影响及其处理为改进 CLIP 训练的有效性(包括语言重写技术)提供了宝贵见解。
引用
@article{arxiv.2309.13770,
title = {Devil in the Number: Towards Robust Multi-modality Data Filter},
author = {Yichen Xu and Zihan Xu and Wenhao Chai and Zhonghan Zhao and Enxin Song and Gaoang Wang},
journal= {arXiv preprint arXiv:2309.13770},
year = {2023}
}
备注
ICCV 2023 Workshop: TNGCV-DataComp