中文

ToSA:面向高效视觉Transformer的令牌选择性注意力

计算机视觉与模式识别 2024-06-14 v1

摘要

在本文中,我们提出了一种新颖的令牌选择性注意力方法ToSA,它可以识别需要被关注的令牌以及可以跳过Transformer层的令牌。更具体地说,一个令牌选择器解析当前的注意力图并预测下一层的注意力图,然后这些注意力图被用来选择应该参与注意力操作的重要令牌。剩余的令牌简单地绕过下一层,并与被关注的令牌连接起来,重新形成完整的令牌集。通过这种方式,我们减少了二次计算和内存成本,因为更少的令牌参与自注意力,同时为网络中的所有图像块保留了特征,这使得它可以用于密集预测任务。我们的实验表明,通过应用ToSA,我们可以在ImageNet分类基准上显著降低计算成本,同时保持准确性。此外,我们在NYU Depth V2上的单目深度估计这一密集预测任务上进行了评估,并表明使用带有ToSA的轻量级骨干网络可以实现相似的深度预测精度。

关键词

引用

@article{arxiv.2406.08816,
  title  = {ToSA: Token Selective Attention for Efficient Vision Transformers},
  author = {Manish Kumar Singh and Rajeev Yasarla and Hong Cai and Mingu Lee and Fatih Porikli},
  journal= {arXiv preprint arXiv:2406.08816},
  year   = {2024}
}

备注

Accepted at CVPRW 2024