通过细粒度流形蒸馏学习高效视觉 Transformer
计算机视觉与模式识别
2022-06-03 v4
摘要
过去几年中,transformer 在各种计算机视觉任务上取得了令人瞩目的性能。遗憾的是,大多数现有视觉 transformer 巨大的推理开销阻碍了它们在手机与智能手表等边缘设备上的部署。知识蒸馏是一种广泛使用的范式,通过向紧凑学生模型迁移信息来压缩笨重架构。然而,其中多数专为卷积神经网络(CNN)设计,未能充分考察视觉 transformer(ViT)的特性。本文中,我们利用块级信息并提出一种细粒度流形蒸馏方法。具体而言,我们训练一个微小学生模型以在块级流形空间中匹配预训练教师模型。随后,我们将流形匹配损失解耦为三项并精心设计并进一步降低块关系计算成本。借助所提方法,含 5M 参数的 DeiT-Tiny 模型在 ImageNet-1k 上达到 76.5% 的 top-1 准确率,较先前蒸馏方法高 +2.0%。在其他分类基准与下游视觉任务上的迁移学习结果也证明了我们的方法优于最先进算法。
引用
@article{arxiv.2107.01378,
title = {Learning Efficient Vision Transformers via Fine-Grained Manifold Distillation},
author = {Zhiwei Hao and Jianyuan Guo and Ding Jia and Kai Han and Yehui Tang and Chao Zhang and Han Hu and Yunhe Wang},
journal= {arXiv preprint arXiv:2107.01378},
year = {2022}
}