LGViT:用于加速视觉Transformer的动态早退机制
计算机视觉与模式识别
2023-08-02 v1 人工智能
摘要
近年来,在资源受限的边缘设备上高效部署并加速强大的视觉Transformer(ViT)以提供多媒体服务已成为引人关注的任务。尽管早退是加速推理的可行方案,但多数工作聚焦于卷积神经网络(CNN)和自然语言处理(NLP)中的Transformer模型。此外,将早退方法直接应用于ViT可能导致显著的性能下降。为应对这一挑战,我们系统研究了早退在ViT中的有效性,并指出浅层内部分类器特征表示不足以及深层内部分类器捕获目标语义信息能力有限制约了这些方法的表现。我们随后提出一种面向通用ViT的早退框架LGViT,其引入异构退出头,即局部感知头与全局聚合头,以实现效率-精度权衡。特别地,我们开发了一种新颖的两阶段训练方案,包括端到端训练以及主干冻结下的自蒸馏以生成早退ViT,从而促进两类头部提取的全局与局部信息融合。我们使用三种流行ViT主干在三个视觉数据集上进行了大量实验。结果表明,我们的LGViT能以约1.8的加速取得具有竞争力的性能。
引用
@article{arxiv.2308.00255,
title = {LGViT: Dynamic Early Exiting for Accelerating Vision Transformer},
author = {Guanyu Xu and Jiawei Hao and Li Shen and Han Hu and Yong Luo and Hui Lin and Jialie Shen},
journal= {arXiv preprint arXiv:2308.00255},
year = {2023}
}
备注
ACM MM 2023