Meta CLIP 2:全球规模化配方
计算机视觉与模式识别
2025-08-04 v3 计算与语言
摘要
对比语言-图像预训练(CLIP)是一种流行的基础模型,支持从零样本分类、检索到多模态大语言模型(MLLMs)的编码器。虽然 CLIP 已成功在来自英文世界的十亿级图像-文本对上进行训练,但将 CLIP 的训练进一步扩展到来自全球 web 数据的学习仍具有挑战性:(1)没有可用于处理来自非英文世界数据点的清洗方法;(2)现有的多语言 CLIP 的英文性能不如其英文唯一版本,即“多语言诅咒”,这是 LLMs 中常见的现象。本文提出了 Meta CLIP 2,即首个在全球 web 规模的图像-文本对上从头训练 CLIP 的配方。为验证我们的发现的普遍性,我们进行了严格的消融实验,仅进行必要的最小更改即可解决上述挑战,并提出一种配方,使英文和非英文世界数据能够相互受益。在零样本 ImageNet 分类中,Meta CLIP 2 ViT-H/14 超过其英文唯一版本 0.8%,超过 mSigLIP 0.7%,并令人惊讶的是在无系统级干扰因素(如翻译、专用架构更改)的情况下,在多语言基准测试中实现了最先进的性能,如 CVQA 中的 57.4%,Babel-ImageNet 中的 50.2%,XM3600 中的 64.3%(图像到文本检索)。
引用
@article{arxiv.2507.22062,
title = {Meta CLIP 2: A Worldwide Scaling Recipe},
author = {Yung-Sung Chuang and Yang Li and Dong Wang and Ching-Feng Yeh and Kehan Lyu and Ramya Raghavendra and James Glass and Lifei Huang and Jason Weston and Luke Zettlemoyer and Xinlei Chen and Zhuang Liu and Saining Xie and Wen-tau Yih and Shang-Wen Li and Hu Xu},
journal= {arXiv preprint arXiv:2507.22062},
year = {2025}
}
备注
10 pages