高效视觉Transformer综述:算法、技术与性能基准测试
计算机视觉与模式识别
2024-05-06 v2
摘要
视觉Transformer(ViT)架构正日益流行,并被广泛用于处理计算机视觉应用。其主要特征是通过自注意力机制提取全局信息的能力,优于早期的卷积神经网络。然而,ViT 的部署与性能随其规模、可训练参数数量与操作数而稳步增长。此外,自注意力的计算与内存成本随图像分辨率呈二次增长。一般而言,由于处理与计算能力等诸多硬件及环境限制,在这些实际应用中采用此类架构颇具挑战。因此,本综述调研了确保次优估计性能的最高效方法。更具体地,将分析四类高效方法:紧凑架构、剪枝、知识蒸馏与量化策略。此外,为归一化并比较推理时影响硬件设备的模型特征(如参数数量、比特数、FLOPs 与模型大小),引入了称为高效错误率的新指标。综上,本文首先数学定义了使视觉Transformer高效化的策略,描述并讨论了前沿方法,并分析了它们在不同应用场景下的性能。文末我们还讨论了开放挑战与有前景的研究方向。
引用
@article{arxiv.2309.02031,
title = {A survey on efficient vision transformers: algorithms, techniques, and performance benchmarking},
author = {Lorenzo Papa and Paolo Russo and Irene Amerini and Luping Zhou},
journal= {arXiv preprint arXiv:2309.02031},
year = {2024}
}