ToSA:面向高效视觉Transformer的令牌选择性注意力
计算机视觉与模式识别
2024-06-14 v1
摘要
在本文中,我们提出了一种新颖的令牌选择性注意力方法ToSA,它可以识别需要被关注的令牌以及可以跳过Transformer层的令牌。更具体地说,一个令牌选择器解析当前的注意力图并预测下一层的注意力图,然后这些注意力图被用来选择应该参与注意力操作的重要令牌。剩余的令牌简单地绕过下一层,并与被关注的令牌连接起来,重新形成完整的令牌集。通过这种方式,我们减少了二次计算和内存成本,因为更少的令牌参与自注意力,同时为网络中的所有图像块保留了特征,这使得它可以用于密集预测任务。我们的实验表明,通过应用ToSA,我们可以在ImageNet分类基准上显著降低计算成本,同时保持准确性。此外,我们在NYU Depth V2上的单目深度估计这一密集预测任务上进行了评估,并表明使用带有ToSA的轻量级骨干网络可以实现相似的深度预测精度。
引用
@article{arxiv.2406.08816,
title = {ToSA: Token Selective Attention for Efficient Vision Transformers},
author = {Manish Kumar Singh and Rajeev Yasarla and Hong Cai and Mingu Lee and Fatih Porikli},
journal= {arXiv preprint arXiv:2406.08816},
year = {2024}
}
备注
Accepted at CVPRW 2024