RepMLP:将卷积重参数化为全连接层以用于图像识别
计算机视觉与模式识别
2022-03-31 v3 人工智能
机器学习
摘要
我们提出 RepMLP,一种用于图像识别的多层感知机风格神经网络构建模块,其由一系列全连接(FC)层组成。与卷积层相比,FC 层更高效、更擅长建模长程依赖与位置模式,但在捕捉局部结构方面更差,因此通常较少受图像识别任务青睐。我们提出一种结构重参数化技术,将局部先验注入 FC 使其对图像识别强大有效。具体而言,我们在训练期间于 RepMLP 内部构造卷积层,并将其合并入 FC 用于推理。在 CIFAR 上,一个简单的纯 MLP 模型表现出与 CNN 非常接近的性能。通过将 RepMLP 插入传统 CNN,我们在 ImageNet 上将 ResNets 精度提升 1.8%,人脸识别提升 2.9%,Cityscapes 上 mIoU 提升 2.3%,且 FLOPs 更低。我们引人入胜的发现强调,将 FC 的全局表征能力与位置感知同卷积的局部先验相结合,可提升神经网络在具有平移不变性的任务(如语义分割)以及具有对齐图像与位置模式的任务(如人脸识别)上的性能且速度更快。代码与模型见 https://github.com/DingXiaoH/RepMLP。
引用
@article{arxiv.2105.01883,
title = {RepMLP: Re-parameterizing Convolutions into Fully-connected Layers for Image Recognition},
author = {Xiaohan Ding and Chunlong Xia and Xiangyu Zhang and Xiaojie Chu and Jungong Han and Guiguang Ding},
journal= {arXiv preprint arXiv:2105.01883},
year = {2022}
}
备注
This was a work in progress. Latest version is arXiv:2112.11081 (accepted by CVPR 2022)