中文

视觉 Transformer 的有趣特性

计算机视觉与模式识别 2021-11-29 v3 人工智能 机器学习

摘要

视觉 Transformer(ViT)已在各类机器视觉任务中展现出令人印象深刻的性能。这些模型基于多头自注意力机制,可灵活地对图像块序列进行注意力操作以编码上下文线索。一个重要的问题是:这种在给定图像块条件下对全图上下文进行灵活注意力建模的能力,如何有助于处理自然图像中的干扰因素,例如严重遮挡、域偏移、空间置换、对抗性与自然扰动。我们通过涵盖三种 ViT 系列并与高性能卷积神经网络(CNN)比较的大量实验系统地研究了该问题。我们展示并分析了 ViT 的如下有趣特性:(a) Transformer 对严重遮挡、扰动和域偏移具有高度鲁棒性,例如即使在随机遮挡 80% 图像内容后,在 ImageNet 上仍保持高达 60% 的 top-1 准确率。(b) 对遮挡的鲁棒性并非源于对局部纹理的偏置,且相较于 CNN,ViT 对纹理的偏置显著更小。当被恰当地训练以编码基于形状的特征时,ViT 展现出可与人类视觉系统相媲美的形状识别能力,这是此前文献中未实现的。(c) 利用 ViT 编码形状表示会带来一个有趣结果:无需像素级监督即可实现准确的语义分割。(d) 单个 ViT 模型的现成特征可被组合以创建特征集成,从而在传统与少样本学习范式下的一系列分类数据集上取得高准确率。我们表明 ViT 的有效特征源于自注意力机制所实现的灵活且动态的 receptive field(感受野)。

关键词

引用

@article{arxiv.2105.10497,
  title  = {Intriguing Properties of Vision Transformers},
  author = {Muzammal Naseer and Kanchana Ranasinghe and Salman Khan and Munawar Hayat and Fahad Shahbaz Khan and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:2105.10497},
  year   = {2021}
}

备注

NeurIPS'21 (Spotlight), Code: https://git.io/Js15X