视觉 Transformer 中的令牌池化
计算机视觉与模式识别
2023-02-28 v2 机器学习
摘要
尽管近期在许多应用中取得成功,视觉 Transformer 的高计算需求限制了其在资源受限环境中的应用。虽然许多现有方法改善了注意力的二次复杂度,但在大多数视觉 Transformer 中,自注意力并非主要计算瓶颈,例如超过 80% 的计算消耗在全连接层上。为改善所有层的计算复杂度,我们提出一种新颖的令牌下采样方法,称为令牌池化(Token Pooling),有效利用图像和中间令牌表示中的冗余。我们表明,在温和假设下,softmax 注意力充当高维低通(平滑)滤波器。因此,其输出包含可被剪除以实现计算成本与精度间更佳权衡的冗余。我们的新技术通过最小化下采样引起的重建误差来精确近似一组令牌。我们通过低成本聚类解决该优化问题。我们严格分析并与先前的下采样方法比较。实验表明,令牌池化显著改善了优于最先进下采样的成本-精度权衡。令牌池化是一种简单有效的算子,可惠及许多架构。应用于 DeiT,其以少 42% 的计算量实现了相同的 ImageNet top-1 精度。
引用
@article{arxiv.2110.03860,
title = {Token Pooling in Vision Transformers},
author = {Dmitrii Marin and Jen-Hao Rick Chang and Anurag Ranjan and Anish Prabhu and Mohammad Rastegari and Oncel Tuzel},
journal= {arXiv preprint arXiv:2110.03860},
year = {2023}
}