自适应令牌采样以实现高效视觉 Transformer
计算机视觉与模式识别
2022-07-27 v3
摘要
尽管最先进的视觉 transformer 模型在图像分类中取得了有前景的结果,它们计算昂贵且需要许多 GFLOPs。虽然可通过减少网络中令牌数量来降低视觉 transformer 的 GFLOPs,但不存在对所有输入图像皆最优的设置。因此,本工作中我们引入了一个可微的无参数自适应令牌采样器(ATS)模块,其可插入任何现有的视觉 transformer 架构。ATS 通过评分与自适应采样显著令牌来增强视觉 transformer。结果,令牌数量不再恒定,而是随每个输入图像变化。通过将 ATS 作为附加层集成到当前 transformer 块中,我们可以将其转换为具有自适应令牌数量的更高效视觉 transformer。由于 ATS 是无参数模块,它可作为即插即用模块添加到现成的预训练视觉 transformer 上,从而在不额外训练的情况下降低其 GFLOPs。此外,由于其可微设计,也可训练配备 ATS 的视觉 transformer。我们通过将 ATS 添加到多个 SOTA 视觉 transformer 上,在图像与视频分类任务中评估了模块的效率。我们提出的模块将 SOTA 的计算成本(GFLOPs)降低 2 倍,同时在 ImageNet、Kinetics-400 与 Kinetics-600 数据集上保持其精度。
引用
@article{arxiv.2111.15667,
title = {Adaptive Token Sampling For Efficient Vision Transformers},
author = {Mohsen Fayyaz and Soroush Abbasi Koohpayegani and Farnoush Rezaei Jafari and Sunando Sengupta and Hamid Reza Vaezi Joze and Eric Sommerlade and Hamed Pirsiavash and Juergen Gall},
journal= {arXiv preprint arXiv:2111.15667},
year = {2022}
}
备注
ECCV 2022