EVA-02:面向新纪元的视觉表示
计算机视觉与模式识别
2024-08-02 v2 计算与语言
摘要
我们推出 EVA-02,一种基于 Transformer 的下一代视觉表示,通过掩码图像建模预训练以重建强且鲁棒的语言对齐视觉特征。借助更新的朴素 Transformer 架构以及来自开放且可获取的巨型 CLIP 视觉编码器的广泛预训练,EVA-02 在各种代表性视觉任务上相比先前最先进方法展现出更优性能,同时显著减少了参数量与计算预算。值得注意的是,仅使用公开可获取的训练数据,参数量仅 304M 的 EVA-02 在 ImageNet-1K 验证集上取得了惊人的 90.0 微调 top-1 准确率。此外,我们的 EVA-02-CLIP 在 ImageNet-1K 上可达到高达 80.4 的零样本 top-1,以仅约 1/6 的参数量和约 1/6 的图像-文本训练数据超越了先前最大且最佳的开放源代码 CLIP。我们提供四种不同模型规模(参数量从 6M 到 304M)的 EVA-02 变体,均具备令人印象深刻的性能。为促进开放获取与开放研究,我们在 https://github.com/baaivision/EVA/tree/master/EVA-02 向社区发布完整的 EVA-02 套件。
引用
@article{arxiv.2303.11331,
title = {EVA-02: A Visual Representation for Neon Genesis},
author = {Yuxin Fang and Quan Sun and Xinggang Wang and Tiejun Huang and Xinlong Wang and Yue Cao},
journal= {arXiv preprint arXiv:2303.11331},
year = {2024}
}
备注
v2: Fix some known issues & typos. v1: To Asuka. Code & Models: https://github.com/baaivision/EVA/tree/master/EVA-02