中文

SAC-ViT:带提前退出的语义感知聚类视觉 Transformer

计算机视觉与模式识别 2025-03-04 v1 人工智能

摘要

视觉 Transformer(ViT)在全局建模方面表现出色,但由于其注意力机制的二次计算复杂度,在资源受限设备上的部署面临挑战。为解决这一问题,我们提出了语义感知聚类视觉 Transformer(SAC-ViT),一种非迭代方法以提升 ViT 的计算效率。SAC-ViT 分两个阶段运行:提前退出(EE)和语义感知聚类(SAC)。在 EE 阶段,对下采样输入图像进行处理以提取全局语义信息并生成初始推理结果。若这些结果不满足 EE 终止条件,则将信息聚类为目标和非目标 token。在 SAC 阶段,目标 token 被映射回原始图像、裁剪并嵌入。这些目标 token 随后与 EE 阶段复用的非目标 token 结合,并在每个聚类内应用注意力机制。这种两阶段设计通过端到端优化减少了空间冗余并提升了计算效率,显著增强了 ViT 的整体性能。大量实验验证了 SAC-ViT 的有效性,将 DeiT 的 FLOPs 降低了 62%,并在不牺牲性能的情况下实现了 1.98 倍的吞吐量。

关键词

引用

@article{arxiv.2503.00060,
  title  = {SAC-ViT: Semantic-Aware Clustering Vision Transformer with Early Exit},
  author = {Youbing Hu and Yun Cheng and Anqi Lu and Dawei Wei and Zhijun Li},
  journal= {arXiv preprint arXiv:2503.00060},
  year   = {2025}
}