中文

视觉Transformer中的知识蒸馏:一项批判性综述

计算机视觉与模式识别 2024-02-13 v2

摘要

在自然语言处理(NLP)中,Transformer已通过利用基于注意力的编码器-解码器模型彻底改变了该领域。近期,一些开创性工作将类Transformer架构应用于计算机视觉(CV),并报告了这些架构在图像分类、目标检测和语义分割等任务中的卓越性能。视觉Transformer(ViTs)因其强大的建模能力,已展现出相较于卷积神经网络(CNNs)令人瞩目的性能提升。然而,这些架构需要巨大的计算资源,使得这些模型难以部署在资源受限的应用中。为解决此问题,已开发出许多方案,如压缩式Transformer以及空洞卷积、最小-最大池化、一维卷积等压缩函数。模型压缩作为潜在补救措施,近期吸引了大量研究关注。文献中已提出多种模型压缩方法,如权重量化、权重复用、剪枝和知识蒸馏(KD)。然而,权重量化、剪枝和权重复用等技术通常涉及复杂的压缩流水线。KD已被发现是一种简单且高效的模型压缩技术,可使相对简单的模型几乎像复杂模型一样准确地执行任务。本文讨论了基于KD有效压缩ViT模型的各种方法。文章阐明了KD在降低这些模型计算和内存需求方面所起的作用。本文还呈现了ViTs面临的各种尚待解决的挑战。

关键词

引用

@article{arxiv.2302.02108,
  title  = {Knowledge Distillation in Vision Transformers: A Critical Review},
  author = {Gousia Habib and Tausifa Jan Saleem and Brejesh Lall},
  journal= {arXiv preprint arXiv:2302.02108},
  year   = {2024}
}

备注

28pages, 16 figures