中文

EVA-CLIP-18B:将CLIP扩展到180亿参数

计算机视觉与模式识别 2024-02-07 v1

摘要

扩展对比语言-图像预训练(CLIP)对于增强视觉和多模态模型至关重要。我们提出了EVA-CLIP-18B,这是迄今为止最大、最强大的开源CLIP模型,拥有180亿参数。仅使用60亿训练样本,EVA-CLIP-18B在27个广泛认可的图像分类基准上平均达到了80.7%的零样本top-1准确率,大幅超越了其前身EVA-CLIP(50亿参数)和其他开源CLIP模型。值得注意的是,尽管训练数据集保持不变(来自LAION-2B和COYO-700M的20亿图像-文本对),我们观察到EVA-CLIP的模型大小扩展带来了持续的性能提升。该数据集是公开可用的,并且比其他最先进CLIP模型使用的内部数据集(例如DFN-5B、WebLI-10B)小得多。EVA-CLIP-18B展示了EVA风格的弱到强视觉模型扩展的潜力。通过公开我们的模型权重,我们希望促进视觉和多模态基础模型的未来研究。

关键词

引用

@article{arxiv.2402.04252,
  title  = {EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters},
  author = {Quan Sun and Jinsheng Wang and Qiying Yu and Yufeng Cui and Fan Zhang and Xiaosong Zhang and Xinlong Wang},
  journal= {arXiv preprint arXiv:2402.04252},
  year   = {2024}
}