ASAP:基于注意力汇聚的剪枝方法
机器学习
2026-05-22 v1
摘要
视觉 Transformer (ViT) 因自注意力在高分辨率下的二次复杂度,面临严重的计算瓶颈。现有的 token 降采样方法依赖局部指标——如单层注意力得分——这些指标本质上易受注意力汇聚现象的影响,即无信息 token 被悖论性地保留下来而忽略了对显眼前景对象的保存。我们提出 ASAP (Attention Sink Anchored Pruning),一个以训练无关的方式将此类汇聚建模为特征的框架。通过将 ViT 信息流建模为懒惰随机漫步,ASAP 识别出汇聚作为概率质量的主导累加器。计算汇聚在累计转移矩阵中的扩散距离,ASAP 通过径向扩散聚类对 token 进行分区,并通过转移权重池化压缩背景冗余,实现一次性完成。广泛的实验在图像、视频和视觉语言任务上表明,ASAP 超越了当前最先进的方法,在保持甚至提升基准准确率的同时,将吞吐量提高了最高可达 48%。
关键词
引用
@article{arxiv.2605.22372,
title = {ASAP: Attention Sink Anchored Pruning},
author = {Jaehyuk Lee and Hanyoung Kim and Yanggee Kim and Donghun Lee},
journal= {arXiv preprint arXiv:2605.22372},
year = {2026}
}