中文

EVA-CLIP:面向大规模 CLIP 训练的改进技术

计算机视觉与模式识别 2023-03-28 v1

摘要

对比语言-图像预训练(简称 CLIP)因其在多种场景中的潜力而受到越来越多的关注。本文提出 EVA-CLIP,一系列显著提升 CLIP 训练效率与效果的模型。我们的方法融合了表征学习、优化与增强方面的新技术,使 EVA-CLIP 在相同参数量下相比以往 CLIP 模型以显著更小的训练代价取得更优性能。值得注意的是,我们最大的 5.0B 参数 EVA-02-CLIP-E/14+ 仅用 90 亿可见样本即在 ImageNet-1K val 上取得 82.0 零样本 top-1 准确率;参数量仅 4.3 亿、可见样本 60 亿的较小 EVA-02-CLIP-L/14+ 在 ImageNet-1K val 上取得 80.4 零样本 top-1 准确率。为促进开放获取与开放研究,我们在 https://github.com/baaivision/EVA/tree/master/EVA-CLIP 向社区发布完整的 EVA-CLIP 套件。

关键词

引用

@article{arxiv.2303.15389,
  title  = {EVA-CLIP: Improved Training Techniques for CLIP at Scale},
  author = {Quan Sun and Yuxin Fang and Ledell Wu and Xinlong Wang and Yue Cao},
  journal= {arXiv preprint arXiv:2303.15389},
  year   = {2023}
}

备注

To Rei and the moon. Code & Models: https://github.com/baaivision/EVA/tree/master/EVA-CLIP