中文

SdAE:自蒸馏掩码自编码器

计算机视觉与模式识别 2022-08-02 v1

摘要

随着 BeiT 和 MAE 等基于生成的自监督学习(SSL)方法的发展,如何通过掩码输入图像的随机块并重建缺失信息来学习良好表示日益受到关注。然而,BeiT 和 PeCo 需要一个“预预训练”阶段来生成用于掩码块表示的离散码本。MAE 不需要预训练码本过程,但将像素设为重建目标可能会引入预训练与下游任务之间的优化鸿沟,即良好的重建质量未必总能带来模型的高描述能力。考虑到上述问题,本文提出一种简单的自蒸馏掩码自编码器网络,即 SdAE。SdAE 由一个采用编码器-解码器结构重建缺失信息的学生分支,以及一个生成掩码令牌潜在表示的教师分支组成。我们还从信息瓶颈的角度分析了如何为教师分支构建良好视图以生成潜在表示。此后,我们提出一种多折掩码策略,为提升性能提供具有均衡信息的多个掩码视图,同时也能降低计算复杂度。我们的方法泛化性良好:仅以 300 轮预训练,一个原始 ViT-Base 模型在 ImageNet-1k 分类上达到 84.1% 微调准确率,在 ADE20K 分割上达到 48.6 mIOU,在 COCO 检测上达到 48.9 mAP,大幅超越其他方法。代码见 https://github.com/AbrahamYabo/SdAE。

关键词

引用

@article{arxiv.2208.00449,
  title  = {SdAE: Self-distillated Masked Autoencoder},
  author = {Yabo Chen and Yuchen Liu and Dongsheng Jiang and Xiaopeng Zhang and Wenrui Dai and Hongkai Xiong and Qi Tian},
  journal= {arXiv preprint arXiv:2208.00449},
  year   = {2022}
}

备注

Accepted to ECCV 2022