BEiT v2:基于向量量化视觉分词器的掩码图像建模
计算机视觉与模式识别
2022-10-04 v2
摘要
掩码图像建模(MIM)通过恢复被损坏的图像块,已在自监督表示学习中展现出令人印象深刻的成果。然而,大多数现有研究作用于低层图像像素,这阻碍了对表示模型高层语义的利用。本工作中,我们提出使用语义丰富的视觉分词器作为掩码预测的重建设计目标,提供了一种将 MIM 从像素级系统提升至语义级的方法。具体而言,我们提出向量量化知识蒸馏来训练该分词器,将连续语义空间离散化为紧凑码。随后我们通过预测掩码图像块的原视觉 token 来预训练视觉 Transformer。此外,我们引入一种块聚合策略,将离散图像块相关联以增强全局语义表示。在图像分类与语义分割上的实验表明 BEiT v2 优于所有对比的 MIM 方法。在 ImageNet-1K(224 尺寸)上,base 规模 BEiT v2 微调取得 85.5% top-1 准确率,线性探测取得 80.1% top-1 准确率。large 规模 BEiT v2 在 ImageNet-1K(224 尺寸)微调取得 87.3% top-1 准确率,在 ADE20K 语义分割上取得 56.7% mIoU。代码与预训练模型见 https://aka.ms/beitv2。
引用
@article{arxiv.2208.06366,
title = {BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers},
author = {Zhiliang Peng and Li Dong and Hangbo Bao and Qixiang Ye and Furu Wei},
journal= {arXiv preprint arXiv:2208.06366},
year = {2022}
}