用于视觉识别的瓶颈Transformer
计算机视觉与模式识别
2021-08-04 v2 人工智能
机器学习
摘要
我们提出 BoTNet,一种概念简单但强大的骨干网络架构,它将自注意力机制引入多项计算机视觉任务,包括图像分类、目标检测和实例分割。仅通过将 ResNet 最后三个瓶颈块中的空间卷积替换为全局自注意力,且不做其他改动,我们的方法在实例分割和目标检测上显著优于基线,同时减少了参数量,且延迟开销极小。通过 BoTNet 的设计,我们还指出带有自注意力的 ResNet 瓶颈块可被视为 Transformer 块。无需任何额外技巧,BoTNet 在 COCO 实例分割基准上使用 Mask R-CNN 框架取得了 44.4% 的 Mask AP 和 49.7% 的 Box AP;超越了先前在 COCO 验证集上评估的 ResNeSt 发布的最佳单模型和单尺度结果。最后,我们提出一种将 BoTNet 设计简单适配于图像分类的方法,得到的模型在 ImageNet 基准上取得了 84.7% 的 top-1 准确率,同时在 TPU-v3 硬件上计算时间比流行的 EfficientNet 模型快至多 1.64 倍。我们希望这种简单有效的方法能作为未来视觉自注意力模型研究的强基线。
引用
@article{arxiv.2101.11605,
title = {Bottleneck Transformers for Visual Recognition},
author = {Aravind Srinivas and Tsung-Yi Lin and Niki Parmar and Jonathon Shlens and Pieter Abbeel and Ashish Vaswani},
journal= {arXiv preprint arXiv:2101.11605},
year = {2021}
}
备注
Technical Report, 20 pages, 13 figures, 19 tables