PSLT:具有阶梯自注意力与渐进式平移的轻量级 Vision Transformer
计算机视觉与模式识别
2023-04-10 v1
摘要
Vision Transformer (ViT) 因其建模长程依赖的能力而在各种视觉任务中展现出巨大潜力。然而,ViT 需要大量的计算资源来计算全局自注意力。在这项工作中,我们提出了一种具有多分支的阶梯自注意力块和渐进式平移机制,以开发一种需要较少计算资源(例如相对较少的参数量和 FLOPs)的轻量级 Transformer 主干网络,称为渐进式平移阶梯 Transformer (PSLT)。首先,阶梯自注意力块通过在每个分支中建模局部自注意力来降低计算成本。同时,提出渐进式平移机制,通过为每个分支建模多样的局部自注意力并在这些分支之间进行交互,来扩大阶梯自注意力块的感受野。其次,阶梯自注意力块的输入特征沿通道维度为每个分支进行等分,这大大降低了阶梯自注意力块的计算成本(参数量和 FLOPs 仅为近 1/3),然后这些分支的输出通过像素自适应融合进行协作。因此,具有相对较少参数量和 FLOPs 的阶梯自注意力块能够建模长程交互。基于阶梯自注意力块,PSLT 在包括图像分类、目标检测和行人重识别在内的多个视觉任务上表现良好。在 ImageNet-1k 数据集上,PSLT 以 9.2M 参数量和 1.9G FLOPs 实现了 79.9% 的 top-1 准确率,这与几个具有超过 20M 参数量和 4G FLOPs 的现有模型相当。代码可在 https://isee-ai.cn/wugaojie/PSLT.html 获取。
引用
@article{arxiv.2304.03481,
title = {PSLT: A Light-weight Vision Transformer with Ladder Self-Attention and Progressive Shift},
author = {Gaojie Wu and Wei-Shi Zheng and Yutong Lu and Qi Tian},
journal= {arXiv preprint arXiv:2304.03481},
year = {2023}
}
备注
Accepted to IEEE Transaction on Pattern Analysis and Machine Intelligence, 2023 (Submission date: 08-Jul-202)