Vision Permutator:一种用于视觉识别的类 MLP 可置换架构
计算机视觉与模式识别
2021-06-24 v1
摘要
在本文中,我们提出 Vision Permutator,一种概念简单且数据高效的用于视觉识别的类 MLP 架构。通过认识到 2D 特征表示所携带的位置信息的重要性,与近期沿展平空间维度编码空间信息的类 MLP 模型不同,Vision Permutator 使用线性投影分别沿高度和宽度维度编码特征表示。这使得 Vision Permutator 能够沿一个空间方向捕获长程依赖,同时沿另一方向保留精确的位置信息。所得的位置敏感输出随后以互为补充的方式聚合,形成感兴趣对象的具表达力的表示。我们展示了我们的 Vision Permutator 是卷积神经网络(CNNs)和视觉 transformer 的有力竞争者。在不依赖空间卷积或注意力机制的情况下,Vision Permutator 仅使用 25M 可学习参数在 ImageNet 上取得了 81.5% 的 top-1 准确率,无需额外的超大规模训练数据(例如 ImageNet-22k),这远好于同等模型规模约束下的大多数 CNN 和视觉 transformer。当扩展到 88M 时,它达到了 83.2% 的 top-1 准确率。我们希望这项工作能鼓励对重新思考空间信息编码方式的研究,并促进类 MLP 模型的发展。代码可在 https://github.com/Andrew-Qibin/VisionPermutator 获取。
引用
@article{arxiv.2106.12368,
title = {Vision Permutator: A Permutable MLP-Like Architecture for Visual Recognition},
author = {Qibin Hou and Zihang Jiang and Li Yuan and Ming-Ming Cheng and Shuicheng Yan and Jiashi Feng},
journal= {arXiv preprint arXiv:2106.12368},
year = {2021}
}
备注
9 pages