中文

将卷积设计引入视觉 Transformer

计算机视觉与模式识别 2021-04-21 v2

摘要

受 Transformer 在自然语言处理(NLP)任务中成功的启发,出现了一些将 Transformer 应用于视觉领域的尝试(如 ViT 和 DeiT)。然而,纯 Transformer 架构通常需要大量训练数据或额外监督才能获得与卷积神经网络(CNNs)相当的性能。为克服这些局限,我们分析了直接从 NLP 借用 Transformer 架构时的潜在缺陷。随后我们提出了一种新型\textbf{卷积增强图像 Transformer(CeiT)},它结合了 CNN 在提取低级特征、增强局部性方面的优势,以及 Transformer 在建立长程依赖方面的优势。对原始 Transformer 做了三处修改:\textbf{1)} 不同于从原始输入图像直接分块,我们设计了\textbf{图像到令牌(I2T)}模块,从生成的低级特征中提取图像块;\textbf{2)} 每个编码器块中的前馈网络被替换为\textbf{局部增强前馈(LeFF)}层,以促进空间维度上相邻令牌间的关联;\textbf{3)} 在 Transformer 顶端附加\textbf{逐层类令牌注意力(LCA)},利用多层次表示。在 ImageNet 和七个下游任务上的实验结果表明,与先前 Transformer 及最先进的 CNN 相比,CeiT 在不需大量训练数据和额外 CNN 教师模型的情况下具有有效性与泛化能力。此外,CeiT 模型以少 3×3\times 的训练迭代也展现出更好的收敛性,可显著减少训练成本\footnote{代码与模型将在录用后发布}。

关键词

引用

@article{arxiv.2103.11816,
  title  = {Incorporating Convolution Designs into Visual Transformers},
  author = {Kun Yuan and Shaopeng Guo and Ziwei Liu and Aojun Zhou and Fengwei Yu and Wei Wu},
  journal= {arXiv preprint arXiv:2103.11816},
  year   = {2021}
}