中文

基于注意力感知词元过滤的 Vision Transformer 模型加速

计算机视觉与模式识别 2025-06-03 v1

摘要

Vision Transformer (ViT) 模型在图像嵌入提取方面取得了突破,在零样本图像分类等任务中提供了 SOTA 性能。然而,此类模型存在计算负担过高的问题。本文提出了一种面向 ViT 模型的全新加速方法,称为注意力感知词元过滤 (ATF)。ATF 包含两个核心思想:一个新颖的词元过滤模块和一种过滤策略。该词元过滤模块被引入至 ViT 模型的分词器与 Transformer 编码器之间,且无需修改或微调 Transformer 编码器。该模块会对输入至编码器的词元进行过滤,从而动态保留特定目标类型所在区域的词元,并静态保留在 Transformer 编码器中获得高注意力的区域的词元。此过滤策略在过滤输入至 Transformer 编码器的词元的同时,维持了任务准确率。检索任务的评估结果表明,ATF 在维持检索召回率的同时,为 ViT 模型 SigLIP 实现了 2.8×2.8\times 的加速。

关键词

引用

@article{arxiv.2506.01519,
  title  = {Speed-up of Vision Transformer Models by Attention-aware Token Filtering},
  author = {Takahiro Naruko and Hiroaki Akutsu},
  journal= {arXiv preprint arXiv:2506.01519},
  year   = {2025}
}