基于注意力感知词元过滤的 Vision Transformer 模型加速
计算机视觉与模式识别
2025-06-03 v1
摘要
Vision Transformer (ViT) 模型在图像嵌入提取方面取得了突破,在零样本图像分类等任务中提供了 SOTA 性能。然而,此类模型存在计算负担过高的问题。本文提出了一种面向 ViT 模型的全新加速方法,称为注意力感知词元过滤 (ATF)。ATF 包含两个核心思想:一个新颖的词元过滤模块和一种过滤策略。该词元过滤模块被引入至 ViT 模型的分词器与 Transformer 编码器之间,且无需修改或微调 Transformer 编码器。该模块会对输入至编码器的词元进行过滤,从而动态保留特定目标类型所在区域的词元,并静态保留在 Transformer 编码器中获得高注意力的区域的词元。此过滤策略在过滤输入至 Transformer 编码器的词元的同时,维持了任务准确率。检索任务的评估结果表明,ATF 在维持检索召回率的同时,为 ViT 模型 SigLIP 实现了 的加速。
引用
@article{arxiv.2506.01519,
title = {Speed-up of Vision Transformer Models by Attention-aware Token Filtering},
author = {Takahiro Naruko and Hiroaki Akutsu},
journal= {arXiv preprint arXiv:2506.01519},
year = {2025}
}