中文

BEiT v2:基于向量量化视觉分词器的掩码图像建模

计算机视觉与模式识别 2022-10-04 v2

摘要

掩码图像建模(MIM)通过恢复被损坏的图像块,已在自监督表示学习中展现出令人印象深刻的成果。然而,大多数现有研究作用于低层图像像素,这阻碍了对表示模型高层语义的利用。本工作中,我们提出使用语义丰富的视觉分词器作为掩码预测的重建设计目标,提供了一种将 MIM 从像素级系统提升至语义级的方法。具体而言,我们提出向量量化知识蒸馏来训练该分词器,将连续语义空间离散化为紧凑码。随后我们通过预测掩码图像块的原视觉 token 来预训练视觉 Transformer。此外,我们引入一种块聚合策略,将离散图像块相关联以增强全局语义表示。在图像分类与语义分割上的实验表明 BEiT v2 优于所有对比的 MIM 方法。在 ImageNet-1K(224 尺寸)上,base 规模 BEiT v2 微调取得 85.5% top-1 准确率,线性探测取得 80.1% top-1 准确率。large 规模 BEiT v2 在 ImageNet-1K(224 尺寸)微调取得 87.3% top-1 准确率,在 ADE20K 语义分割上取得 56.7% mIoU。代码与预训练模型见 https://aka.ms/beitv2。

关键词

引用

@article{arxiv.2208.06366,
  title  = {BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers},
  author = {Zhiliang Peng and Li Dong and Hangbo Bao and Qixiang Ye and Furu Wei},
  journal= {arXiv preprint arXiv:2208.06366},
  year   = {2022}
}