中文

先模仿后重建:利用特征模仿增强掩码自编码器

计算机视觉与模式识别 2023-03-10 v1

摘要

掩码自编码器(MAE)已成为大规模视觉表征预训练的流行范式。然而,MAE 仅在解码器后重建低层 RGB 信号,且缺乏对编码器的高层语义监督,因此存在学习表征次优和预训练周期长的问题。为缓解此问题,以往方法简单地将 75% 掩码 token 的像素重建目标替换为来自预训练图像-图像(DINO)或图像-语言(CLIP)对比学习的编码特征。与这些工作不同,我们提出用于掩码自编码器的先模仿后重建,称为 MR-MAE,它在预训练期间联合学习高层与低层表征且无干扰。对于高层语义,MR-MAE 对编码器中 25% 可见 token 施加模仿损失,以捕获 CLIP 和 DINO 中编码的预训练模式。对于低层结构,我们继承 MAE 中的重建损失,在解码器后预测 75% 掩码 token 的 RGB 像素值。由于 MR-MAE 在不同分区分别施加高层和低层目标,二者间的学习冲突可被自然克服,并有助于为各类下游任务提供优越的视觉表征。在 ImageNet-1K 上,仅预训练 400 轮的 MR-MAE base 在微调后达到 85.8% 的 top-1 准确率,超越 1600 轮的 MAE base +2.2%,以及此前最优的 BEiT V2 base +0.3%。代码和预训练模型将发布于 https://github.com/Alpha-VL/ConvMAE。

关键词

引用

@article{arxiv.2303.05475,
  title  = {Mimic before Reconstruct: Enhancing Masked Autoencoders with Feature Mimicking},
  author = {Peng Gao and Renrui Zhang and Rongyao Fang and Ziyi Lin and Hongyang Li and Hongsheng Li and Qiao Yu},
  journal= {arXiv preprint arXiv:2303.05475},
  year   = {2023}
}

备注

12 pages, 3 figures