中文

用于视觉 BERT 预训练的引导式掩码自编码器

计算机视觉与模式识别 2022-07-15 v1 机器学习

摘要

我们提出引导式掩码自编码器(BootMAE),一种用于视觉 BERT 预训练的新方法。BootMAE 以两个核心设计改进原始掩码自编码器(MAE):1)提供在线特征作为额外 BERT 预测目标的动量编码器;2)试图减轻编码器在 BERT 预训练中记忆目标特定信息压力的目标感知解码器。第一个设计源于如下观察:使用预训练 MAE 提取特征作为掩码词的 BERT 预测目标可取得更好的预训练性能。因此,我们与原始 MAE 编码器并行添加一个动量编码器,通过其自身表示作为 BERT 预测目标来引导预训练性能。在第二个设计中,我们将目标特定信息(如未掩码图像块像素值)从编码器直接引入解码器,以减轻编码器记忆目标特定信息的压力。从而编码器专注于语义建模,这正是 BERT 预训练的目标,而无需将其容量浪费在记忆与预测目标相关的未掩码词信息上。通过大量实验,我们的 BootMAE 在 ImageNet-1K 上以 ViT-B 骨干取得 84.2%84.2\% Top-1 准确率,在相同预训练轮数下比 MAE 高出 +0.8%+0.8\%。BootMAE 在 ADE20K 语义分割上获得 +1.0+1.0 mIoU 提升,在 COCO 数据集目标检测与分割上获得 +1.3+1.3 box AP、+1.4+1.4 mask AP 提升。代码发布于 https://github.com/LightDXY/BootMAE。

关键词

引用

@article{arxiv.2207.07116,
  title  = {Bootstrapped Masked Autoencoders for Vision BERT Pretraining},
  author = {Xiaoyi Dong and Jianmin Bao and Ting Zhang and Dongdong Chen and Weiming Zhang and Lu Yuan and Dong Chen and Fang Wen and Nenghai Yu},
  journal= {arXiv preprint arXiv:2207.07116},
  year   = {2022}
}

备注

ECCV 2022, code is available at https://github.com/LightDXY/BootMAE