中文

掩码自编码器赋能高效知识蒸馏器

计算机视觉与模式识别 2022-11-11 v2

摘要

本文研究了从预训练模型(尤其是掩码自编码器)蒸馏知识的潜力。我们的方法简单:除了在掩码输入上优化像素重建损失外,我们还最小化教师模型与学生模型中间特征图之间的距离。这一设计带来了计算高效的知识蒸馏框架,因为 1)仅使用一小部分可见图像块,且 2)(笨重的)教师模型只需部分执行,即通过对前几层前向传播输入来获得中间特征图。与直接蒸馏微调模型相比,蒸馏预训练模型显著提升了下游性能。例如,通过将来自 MAE 预训练 ViT-L 的知识蒸馏到 ViT-B,我们的方法达到了 84.0% 的 ImageNet top-1 准确率,比直接蒸馏微调 ViT-L 的基线高出 1.2%。更有趣的是,我们的方法即使在极高掩码率下也能鲁棒地从教师模型蒸馏知识:例如,在 95% 掩码率(蒸馏时仅可见十个图像块)下,我们的 ViT-B 具竞争力地达到 83.6% 的 ImageNet top-1 准确率;令人惊讶的是,仅用四个可见图像块(98% 掩码率)激进训练时,它仍能保证 82.4% 的 ImageNet top-1 准确率。代码和模型公开于 https://github.com/UCSC-VLAA/DMAE。

关键词

引用

@article{arxiv.2208.12256,
  title  = {Masked Autoencoders Enable Efficient Knowledge Distillers},
  author = {Yutong Bai and Zeyu Wang and Junfei Xiao and Chen Wei and Huiyu Wang and Alan Yuille and Yuyin Zhou and Cihang Xie},
  journal= {arXiv preprint arXiv:2208.12256},
  year   = {2022}
}