EVA-CLIP:面向大规模 CLIP 训练的改进技术
计算机视觉与模式识别
2023-03-28 v1
摘要
对比语言-图像预训练(简称 CLIP)因其在多种场景中的潜力而受到越来越多的关注。本文提出 EVA-CLIP,一系列显著提升 CLIP 训练效率与效果的模型。我们的方法融合了表征学习、优化与增强方面的新技术,使 EVA-CLIP 在相同参数量下相比以往 CLIP 模型以显著更小的训练代价取得更优性能。值得注意的是,我们最大的 5.0B 参数 EVA-02-CLIP-E/14+ 仅用 90 亿可见样本即在 ImageNet-1K val 上取得 82.0 零样本 top-1 准确率;参数量仅 4.3 亿、可见样本 60 亿的较小 EVA-02-CLIP-L/14+ 在 ImageNet-1K val 上取得 80.4 零样本 top-1 准确率。为促进开放获取与开放研究,我们在 https://github.com/baaivision/EVA/tree/master/EVA-CLIP 向社区发布完整的 EVA-CLIP 套件。
引用
@article{arxiv.2303.15389,
title = {EVA-CLIP: Improved Training Techniques for CLIP at Scale},
author = {Quan Sun and Yuxin Fang and Ledell Wu and Xinlong Wang and Yue Cao},
journal= {arXiv preprint arXiv:2303.15389},
year = {2023}
}
备注
To Rei and the moon. Code & Models: https://github.com/baaivision/EVA/tree/master/EVA-CLIP