掩码自编码器的由通用到专用知识蒸馏
计算机视觉与模式识别
2023-03-01 v1
摘要
由自监督预训练机制驱动的大型视觉 Transformer(ViT)取得了前所未有的进展。然而,受模型容量限制的小型 ViT 模型从这些预训练机制中获益甚少。知识蒸馏定义了一种将表示从小(学生)模型向大(教师)模型转移的范式。但传统的单阶段蒸馏容易陷入任务特定转移的困境,无法保留对模型泛化至关重要的任务无关知识。在本研究中,我们提出由通用到专用的蒸馏(G2SD),以在经掩码自编码器预训练的大模型监督下挖掘小型 ViT 模型的潜力。在通用蒸馏中,鼓励小模型的 decoder 与大型模型的隐藏表示对齐特征预测,从而转移任务无关知识。在专用蒸馏中,约束小模型的预测与大型模型一致,以转移保障任务性能的任务特定特征。借助 G2SD,原始 ViT-Small 模型在图像分类、目标检测和语义分割上分别达到其教师模型(ViT-Base)98.7%、98.1% 和 99.3% 的性能,为两阶段视觉蒸馏奠定了坚实基线。代码将发布于 https://github.com/pengzhiliang/G2SD。
引用
@article{arxiv.2302.14771,
title = {Generic-to-Specific Distillation of Masked Autoencoders},
author = {Wei Huang and Zhiliang Peng and Li Dong and Furu Wei and Jianbin Jiao and Qixiang Ye},
journal= {arXiv preprint arXiv:2302.14771},
year = {2023}
}
备注
Accepted by CVPR2023