中文

Refiner:精炼视觉 Transformer 的自注意力

计算机视觉与模式识别 2021-06-08 v1

摘要

视觉 Transformer(ViTs)在图像分类任务中已展现出与 CNN 相竞争的准确率。然而,它们通常需要多得多的数据用于模型预训练。近期多数工作致力于设计更复杂的架构或训练方法来解决 ViT 的数据效率问题。但鲜有工作探索改进自注意力机制——这是区分 ViT 与 CNN 的关键因素。与现有工作不同,我们引入了一个概念上简单的方案,称为 refiner,以直接精炼 ViT 的自注意力图。具体而言,refiner 探索注意力扩展,将多头注意力图投影到更高维空间以提升其多样性。此外,refiner 应用卷积来增强注意力图的局部模式,我们证明这等价于以可学习核局部聚合分布式局部注意力特征,再以自注意力全局聚合。大量实验表明 refiner 出奇有效地工作。显著地,它使 ViT 仅用 81M 参数即在 ImageNet 上达到 86% 的 top-1 分类准确率。

关键词

引用

@article{arxiv.2106.03714,
  title  = {Refiner: Refining Self-attention for Vision Transformers},
  author = {Daquan Zhou and Yujun Shi and Bingyi Kang and Weihao Yu and Zihang Jiang and Yuan Li and Xiaojie Jin and Qibin Hou and Jiashi Feng},
  journal= {arXiv preprint arXiv:2106.03714},
  year   = {2021}
}