中文

SPOT:基于Vision Transformer中Token相关性与注意力动态的稀疏化

计算机视觉与模式识别 2025-11-14 v1 图像与视频处理

摘要

尽管Vision Transformer(ViT)在各类任务中展现出了卓越的性能,但其计算需求庞大,随处理的 token 数量呈二次方增长。反映 token 交互分布的紧凑注意力表示,能够指导在注意力计算之前及早检测并减少显著性较低的 token。受此启发,我们提出了基于Token相关性与注意力动态的稀疏化(SPOT),这是一个在 ViT 内部早期检测冗余 token 的框架,它利用跨层的 token 嵌入、交互和注意力动态来推断 token 重要性,从而产生更具上下文感知且可解释的相关性检测过程。SPOT 为 token 稀疏化提供信息并促进此类 token 的消除,在不牺牲性能的前提下提高了计算效率。SPOT 采用了计算轻量的预测器,这些预测器可插入各种 ViT 架构中,并学习在跨层中推导出有效的特定于输入的 token 优先级排序。其多功能设计支持一系列适应不同资源约束的性能水平。实证评估表明,与标准 ViT 相比,效率显著提升高达 40%,同时保持甚至提高了准确率。代码和模型可在 https://github.com/odedsc/SPOT 获取。

关键词

引用

@article{arxiv.2511.10488,
  title  = {SPOT: Sparsification with Attention Dynamics via Token Relevance in Vision Transformers},
  author = {Oded Schlesinger and Amirhossein Farzam and J. Matias Di Martino and Guillermo Sapiro},
  journal= {arXiv preprint arXiv:2511.10488},
  year   = {2025}
}

备注

Project repository: https://github.com/odedsc/SPOT