视觉Transformer中的知识蒸馏:一项批判性综述
计算机视觉与模式识别
2024-02-13 v2
摘要
在自然语言处理(NLP)中,Transformer已通过利用基于注意力的编码器-解码器模型彻底改变了该领域。近期,一些开创性工作将类Transformer架构应用于计算机视觉(CV),并报告了这些架构在图像分类、目标检测和语义分割等任务中的卓越性能。视觉Transformer(ViTs)因其强大的建模能力,已展现出相较于卷积神经网络(CNNs)令人瞩目的性能提升。然而,这些架构需要巨大的计算资源,使得这些模型难以部署在资源受限的应用中。为解决此问题,已开发出许多方案,如压缩式Transformer以及空洞卷积、最小-最大池化、一维卷积等压缩函数。模型压缩作为潜在补救措施,近期吸引了大量研究关注。文献中已提出多种模型压缩方法,如权重量化、权重复用、剪枝和知识蒸馏(KD)。然而,权重量化、剪枝和权重复用等技术通常涉及复杂的压缩流水线。KD已被发现是一种简单且高效的模型压缩技术,可使相对简单的模型几乎像复杂模型一样准确地执行任务。本文讨论了基于KD有效压缩ViT模型的各种方法。文章阐明了KD在降低这些模型计算和内存需求方面所起的作用。本文还呈现了ViTs面临的各种尚待解决的挑战。
引用
@article{arxiv.2302.02108,
title = {Knowledge Distillation in Vision Transformers: A Critical Review},
author = {Gousia Habib and Tausifa Jan Saleem and Brejesh Lall},
journal= {arXiv preprint arXiv:2302.02108},
year = {2024}
}
备注
28pages, 16 figures