Vision Conformer:将卷积融入 Vision Transformer 层
计算机视觉与模式识别
2023-04-28 v1 机器学习
摘要
Transformer 是流行的神经网络模型,使用自注意力层和带有嵌入词元的全连接节点。Vision Transformer (ViT) 将 Transformer 适配于图像识别任务。为此,图像被分割成图像块并用作词元。ViT 的一个问题是缺乏对图像结构的归纳偏置。由于 ViT 是从语言建模适配而来用于图像数据的,网络没有显式处理局部平移、像素信息以及多个图像块共享的结构和特征中的信息丢失等问题。相反,卷积神经网络 (CNN) 包含了这些信息。因此,在本文中,我们提出在 ViT 中使用卷积层。具体来说,我们提出了一个名为 Vision Conformer (ViC) 的模型,它用 CNN 替换了 ViT 层中的多层感知机 (MLP)。此外,为了使用 CNN,我们提出在自注意力之后通过一个反向嵌入层重构图像数据。通过评估,我们证明了所提出的卷积有助于提高 ViT 的分类能力。
引用
@article{arxiv.2304.13991,
title = {Vision Conformer: Incorporating Convolutions into Vision Transformer Layers},
author = {Brian Kenji Iwana and Akihiro Kusuda},
journal= {arXiv preprint arXiv:2304.13991},
year = {2023}
}
备注
Accepted at ICDAR 2023