用基于注意力的聚合增强卷积网络
计算机视觉与模式识别
2021-12-28 v1
摘要
我们展示了如何以基于注意力的全局映射增强任意卷积网络,以实现非局部推理。我们将最终的平均池化替换为一个类似于单个 transformer 块的基于注意力的聚合层,该层对图像块参与分类决策的方式进行加权。我们将此学习的聚合层接入一个由 2 个参数(宽度和深度)参数化的极简基于块卷积网络。与金字塔式设计不同,该架构族在所有层中保持输入块分辨率不变。如我们在多种计算机视觉任务(目标分类、图像分割与检测)上的实验所示,它在准确率与复杂度之间,尤其在内存消耗方面,产生了令人惊讶地具竞争力的权衡。
引用
@article{arxiv.2112.13692,
title = {Augmenting Convolutional networks with attention-based aggregation},
author = {Hugo Touvron and Matthieu Cord and Alaaeldin El-Nouby and Piotr Bojanowski and Armand Joulin and Gabriel Synnaeve and Hervé Jégou},
journal= {arXiv preprint arXiv:2112.13692},
year = {2021}
}