中文

BEiT:图像 Transformer 的 BERT 预训练

计算机视觉与模式识别 2022-09-07 v2 机器学习

摘要

我们提出了一种自监督视觉表示模型 BEiT,即 Bidirectional Encoder representation from Image Transformers(图像 Transformer 的双向编码器表示)。遵循自然语言处理领域提出的 BERT,我们设计了一个掩码图像建模任务来预训练视觉 Transformer。具体而言,在我们的预训练过程中,每张图像有两种视图,即图像块(如 16x16 像素)和视觉 token(即离散 token)。我们首先将原始图像“token 化”为视觉 token。然后随机掩码部分图像块并将其输入骨干 Transformer。预训练目标是基于受损图像块恢复原始视觉 token。在预训练 BEiT 之后,我们通过在预训练编码器上添加任务层,直接在下游任务上微调模型参数。图像分类和语义分割的实验结果表明,我们的模型取得了与先前预训练方法相竞争的结果。例如,基础规模的 BEiT 在 ImageNet-1K 上达到了 83.2% 的 top-1 准确率,在相同设置下显著优于从头训练的 DeiT(81.8%)。此外,大规模 BEiT 仅使用 ImageNet-1K 即获得了 86.3% 的准确率,甚至优于在 ImageNet-22K 上监督预训练的 ViT-L(85.2%)。代码与预训练模型可在 https://aka.ms/beit 获取。

关键词

引用

@article{arxiv.2106.08254,
  title  = {BEiT: BERT Pre-Training of Image Transformers},
  author = {Hangbo Bao and Li Dong and Songhao Piao and Furu Wei},
  journal= {arXiv preprint arXiv:2106.08254},
  year   = {2022}
}

备注

A Path to the BERT Moment of CV