面向百亿规模数据预训练的视觉语言模型
计算机视觉与模式识别
2025-02-12 v1
摘要
我们对在前所未有的规模(1000亿示例)上预训练视觉语言模型的潜力进行经验性调查。我们发现,在许多常见以西方为中心的分类和检索基准(如 COCO Captions)上,模型性能在此规模上趋于饱和。然而,由于其覆盖长尾概念,文化多样性任务从 1000亿规模的网络数据中获得了更大的收益。此外,我们分析了模型的多语言能力,表明在低资源语言中也能获得提升。此外,我们观察到,通过类似 CLIP 用于提升性能的质量过滤器缩小预训练数据集的大小,可能会无意中减少即使在大规模数据集中也所代表的文化多样性。我们的结果表明,尽管传统基准可能不会从将噪声原始网页数据扩展到 1000亿示例中获益显著,但此数据规模对于构建 truly 包容性的多模态系统至关重要。
引用
@article{arxiv.2502.07617,
title = {Scaling Pre-training to One Hundred Billion Data for Vision Language Models},
author = {Xiao Wang and Ibrahim Alabdulmohsin and Daniel Salz and Zhe Li and Keran Rong and Xiaohua Zhai},
journal= {arXiv preprint arXiv:2502.07617},
year = {2025}
}