FcaFormer:混合视觉Transformer中的前向交叉注意力
计算机视觉与模式识别
2023-03-21 v2
摘要
当前,设计更高效视觉Transformer的一条主要研究路线是通过采用稀疏注意力或局部注意力窗口来降低自注意力模块的计算开销。相反,我们提出了一种不同的方法,旨在通过稠化注意力模式来提升基于Transformer架构的性能。具体而言,我们提出了面向混合视觉Transformer的前向交叉注意力(FcaFormer),其中同一阶段中来自先前块的符号被二次利用。为此,FcaFormer利用了两个创新组件:可学习尺度因子(LSFs)与符号合并增强模块(TME)。LSFs实现了对交叉符号的高效处理,而TME生成具代表性的交叉符号。通过集成这些组件,所提出的FcaFormer增强了跨块且可能具有不同语义的符号间的交互,并促使更多信息流向较低层级。基于前向交叉注意力(Fca),我们设计了一系列FcaFormer模型,在模型规模、计算开销、内存开销与精度之间实现了最佳权衡。例如,无需知识蒸馏来强化训练,我们的FcaFormer在ImageNet上以仅1630万参数和约36亿次MACs取得了83.1%的top-1准确率。与蒸馏后的EfficientFormer相比,这节省了近一半的参数与部分计算开销,同时准确率高出0.7%。
引用
@article{arxiv.2211.07198,
title = {Fcaformer: Forward Cross Attention in Hybrid Vision Transformer},
author = {Haokui Zhang and Wenze Hu and Xiaoyu Wang},
journal= {arXiv preprint arXiv:2211.07198},
year = {2023}
}
备注
10 pages, 8 figures. Source code is available at https://github.com/hkzhang91/FcaFormer