DMFormer:缩小CNN与视觉Transformer之间的差距
计算机视觉与模式识别
2022-11-30 v3 人工智能
机器学习
摘要
视觉transformer已在计算机视觉任务中展现出优异性能。由于其自注意力机制计算代价高昂,近期工作尝试以卷积操作替换视觉transformer中的自注意力机制,后者因内置归纳偏置而更高效。然而,这些努力或忽略多级特征,或缺乏动态特性,导致次优性能。本文提出一种动态多级注意力机制(DMA),其通过多核尺寸捕获输入图像的不同模式,并借助门控机制实现输入自适应权重。基于DMA,我们提出名为DMFormer的高效骨干网络。DMFormer采用视觉transformer的整体架构,同时将自注意力机制替换为所提DMA。在ImageNet-1K与ADE20K数据集上的大量实验结果表明,DMFormer取得了SOTA性能,优于同等规模的视觉transformer(ViTs)与卷积神经网络(CNNs)。
引用
@article{arxiv.2209.07738,
title = {DMFormer: Closing the Gap Between CNN and Vision Transformers},
author = {Zimian Wei and Hengyue Pan and Lujun Li and Menglong Lu and Xin Niu and Peijie Dong and Dongsheng Li},
journal= {arXiv preprint arXiv:2209.07738},
year = {2022}
}