用于高效视觉 Transformer 预训练的质心中心化建模
计算机视觉与模式识别
2024-08-02 v2
摘要
掩码图像建模(MIM)是一种使用视觉 Transformer(ViT)的自监督视觉预训练新范式。先前的工作可以是基于像素或基于词元的,分别使用来自参数化分词器模型的原始像素或离散视觉词元。我们提出的基于质心的方法 CCViT,利用 k-means 聚类获得用于图像建模的质心,无需对分词器模型进行有监督训练,其创建仅需数秒。这种非参数质心分词器创建仅需数秒,且词元推理更快。质心凭借局部不变性可同时表示图像块像素和索引词元。具体而言,我们采用图像块掩码和质心替换策略构建损坏输入,并使用两个堆叠的编码器块来预测损坏的图像块词元并重建原始图像块像素。实验表明,我们的 CCViT 在 ImageNet-1K 分类上以 ViT-B 达到 84.4% 的 top-1 准确率,以 ViT-L 达到 86.0%。我们还将预训练模型迁移到其他下游任务。我们的方法在没有外部监督和来自其他模型的蒸馏训练的情况下,与近期基线取得了具有竞争力的结果。
引用
@article{arxiv.2303.04664,
title = {Centroid-centered Modeling for Efficient Vision Transformer Pre-training},
author = {Xin Yan and Zuchao Li and Lefei Zhang},
journal= {arXiv preprint arXiv:2303.04664},
year = {2024}
}
备注
Codes are available at https://github.com/Cakeyan/CCViT_Public