GTP-ViT:基于图令牌传播的高效视觉Transformer
计算机视觉与模式识别
2024-01-09 v2 人工智能
摘要
视觉Transformer(ViTs)已经革新了计算机视觉领域,然而由于其高计算需求,在资源受限设备上的部署仍然具有挑战性。为了加速预训练的ViTs,人们开发了令牌剪枝和令牌合并方法,旨在减少参与计算的令牌数量。然而,这些方法仍存在一些局限性,例如被剪枝令牌带来的图像信息丢失以及令牌匹配过程中的低效。本文提出一种新颖的基于图令牌传播(GTP)方法,以解决高效ViTs中模型效率与信息保持难以兼顾的挑战。受图摘要算法启发,GTP细致地将较不重要令牌的信息传播到在空间与语义上相连且更为重要的令牌上。因此,剩余的少数令牌充当整个令牌图的摘要,使该方法能够在降低计算复杂度的同时保留被消除令牌的关键信息。结合一种创新的令牌选择策略,GTP能够高效识别待传播的图令牌。大量实验验证了GTP的有效性,展示了效率与性能的双重提升。具体而言,在不进行微调的情况下,GTP将DeiT-S和DeiT-B的计算复杂度降低多达26%,而在ImageNet-1K上准确率仅下降极小的0.3%,并且在多种骨干网络上以更快的推理速度显著超越最先进的令牌合并方法。源代码见 https://github.com/Ackesnal/GTP-ViT。
引用
@article{arxiv.2311.03035,
title = {GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation},
author = {Xuwei Xu and Sen Wang and Yudong Chen and Yanping Zheng and Zhewei Wei and Jiajun Liu},
journal= {arXiv preprint arXiv:2311.03035},
year = {2024}
}
备注
Accepted to WACV2024 (Oral)