视觉 Transformer 能执行卷积吗
计算机视觉与模式识别
2021-11-04 v2 机器学习
摘要
若干近期研究表明,基于注意力的网络(如 Vision Transformer(ViT))可在不使用卷积层的情况下,在多个计算机视觉任务上超越卷积神经网络(CNNs)。这自然引出以下问题:ViT 的 self-attention 层能否表达任意卷积操作?在本文中,我们构造性地证明了以图像块作为输入的单个 ViT 层可以执行任意卷积操作,其中多头注意力机制与相对位置编码起着关键作用。我们进一步给出了 Vision Transformer 表达 CNNs 所需头数的下界。与我们的分析相对应,实验结果表明我们证明中的构造可帮助向 Transformers 中注入卷积偏置,并显著提升 ViT 在低数据场景下的性能。
引用
@article{arxiv.2111.01353,
title = {Can Vision Transformers Perform Convolution?},
author = {Shanda Li and Xiangning Chen and Di He and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:2111.01353},
year = {2021}
}