扩展局部自注意力以实现参数高效视觉骨干网络
计算机视觉与模式识别
2021-06-08 v3
摘要
自注意力有望改进计算机视觉系统,因为其感受野的缩放与参数无关且交互依赖于内容,而卷积的缩放依赖于参数且交互与内容无关。最近研究表明,与 ResNet-50 等基线卷积模型相比,自注意力模型在准确率-参数权衡上有令人鼓舞的改进。本工作中,我们旨在开发不仅能超越典型基线模型、甚至能超越高性能卷积模型的自注意力模型。我们提出对自注意力的两种扩展,结合更高效的实现,改善了这些模型的速度、内存使用和准确率。我们利用这些改进开发了名为 HaloNets 的新自注意力模型族,在 ImageNet 分类基准的参数受限设定下达到了最先进准确率。在初步迁移学习实验中,我们发现 HaloNet 模型优于大得多的模型且具有更好的推理性能。在目标检测和实例分割等更难任务上,我们简单的局部自注意力与卷积混合模型显示出对比极强基线的改进。这些结果标志着在证明自注意力模型在传统由卷积模型主导的设定上有效性的又一步。
引用
@article{arxiv.2103.12731,
title = {Scaling Local Self-Attention for Parameter Efficient Visual Backbones},
author = {Ashish Vaswani and Prajit Ramachandran and Aravind Srinivas and Niki Parmar and Blake Hechtman and Jonathon Shlens},
journal= {arXiv preprint arXiv:2103.12731},
year = {2021}
}
备注
CVPR 2021 Oral