从令牌稀疏化视角实现高效视觉Transformer
计算机视觉与模式识别
2023-03-31 v2 机器学习
摘要
对令牌数量的二次计算复杂度限制了视觉Transformer(ViTs)的实际应用。若干工作提出剪枝冗余令牌以实现高效ViTs。然而,这些方法普遍面临(i)准确率急剧下降,(ii)在局部视觉Transformer中应用困难,以及(iii)对下游任务非通用的网络等问题。在本工作中,我们提出一种新颖的语义令牌ViT(STViT),用于高效的全局与局部视觉Transformer,其也可被改进作为下游任务的骨干网络。语义令牌代表聚类中心,它们通过空间池化图像令牌初始化并由注意力恢复,能够自适应表示全局或局部语义信息。由于聚类特性,少量语义令牌即可对全局与局部视觉Transformer达到与大量图像令牌相同的效果。例如,在DeiT-(Tiny,Small,Base)上仅用16个语义令牌即可达到相同准确率,同时推理速度提升超过100%且FLOPs降低近60%;在Swin-(Tiny,Small,Base)上,我们可在每个窗口采用16个语义令牌进一步加速约20%且准确率略有提升。除在图像分类上的巨大成功外,我们还将方法扩展至视频识别。此外,我们设计了一个STViT-R(ecover)网络,基于STViT恢复详细空间信息,使其适用于下游任务,而先前令牌稀疏化方法对此无能为力。实验表明,在目标检测与实例分割中,我们的方法相较原始网络以骨干网络超过30%的FLOPs降低取得了有竞争力的结果。代码见 http://github.com/changsn/STViT-R
引用
@article{arxiv.2303.08685,
title = {Making Vision Transformers Efficient from A Token Sparsification View},
author = {Shuning Chang and Pichao Wang and Ming Lin and Fan Wang and David Junhao Zhang and Rong Jin and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2303.08685},
year = {2023}
}
备注
Accepted by CVPR2023