中文

ToFe:用于高效视觉 Transformer 推理的延迟 Token 冻结与重用

计算机视觉与模式识别 2025-07-23 v1 机器学习

摘要

尽管视觉 Transformer(ViT)在各种视觉任务中取得了显著成功,但其计算昂贵的自注意力机制阻碍了它们在资源受限设备上的部署。Token 缩减通过在前向传播过程中丢弃不重要的 Token,被提出用于提升 Transformer 模型的效率。然而,现有方法对不重要 Token 的处理是不可逆的,阻止了它们在后续模块中的重用。考虑到 Transformer 在不同模块间关注不同的信息,在早期模块中被缩减的 Token 在后续可能是有用的。此外,为了使 Transformer 模型适应资源受限的设备,在模型性能和计算开销之间取得平衡至关重要。为了应对这些挑战,本文引入了一种新颖的 Token 冻结与重用(ToFe)框架,我们在每个阶段识别重要的 Token 并暂时冻结不重要的 Token,允许它们在后续阶段延迟重用。具体而言,我们设计了一个用于 Token 识别的预测模块和一个用于恢复冻结 Token 的近似模块。通过计算预算感知的端到端训练与主干网络联合优化,ToFe 能够在每个模块自适应地处理必要的 Token,从而在保持性能的同时降低计算成本。大量实验表明,ToFe 将 LV-ViT 模型的计算成本降低了 50%,而 Top-1 准确率下降不到 2%,与最先进的方法相比,在性能和复杂度之间实现了更好的权衡。

关键词

引用

@article{arxiv.2507.16260,
  title  = {ToFe: Lagged Token Freezing and Reusing for Efficient Vision Transformer Inference},
  author = {Haoyue Zhang and Jie Zhang and Song Guo},
  journal= {arXiv preprint arXiv:2507.16260},
  year   = {2025}
}