ParC-Net:融合ConvNet与Transformer优点的位置感知循环卷积
摘要
近来,视觉Transformer开始展现出令人印象深刻的成果,显著优于基于大卷积的模型。然而,在面向移动端或资源受限设备的小模型领域,ConvNet在性能与模型复杂度上仍具自身优势。我们提出ParC-Net,一种纯基于ConvNet的骨干模型,通过将视觉Transformer的优点融入ConvNet进一步强化这些优势。具体而言,我们提出位置感知循环卷积(ParC),一种轻量卷积算子,其拥有全局感受野的同时能像局部卷积一样产生位置敏感特征。我们将ParC与挤压-激励(squeeze-excitation)算子结合形成类元Transformer(meta-former)的模型块,其进一步具备如Transformer的注意力机制。上述模块可以即插即用的方式替换ConvNets或Transformers中的相关块。实验结果表明,所提ParC-Net在常见视觉任务与数据集上取得了优于流行轻量ConvNet及基于视觉Transformer模型的性能,同时参数更少、推理更快。在ImageNet-1k分类上,ParC-Net以约500万参数取得78.6%的top-1准确率,相比MobileViT节省11%参数与13%计算成本,但提升0.2%准确率且推理速度加快23%(基于ARM的Rockchip RK3288),相比DeIT仅用0.5倍参数却提升2.7%准确率。在MS-COCO目标检测与PASCAL VOC分割任务上,ParC-Net亦展现更优性能。源代码见https://github.com/hkzhang91/ParC-Net
引用
@article{arxiv.2203.03952,
title = {ParC-Net: Position Aware Circular Convolution with Merits from ConvNets and Transformer},
author = {Haokui Zhang and Wenze Hu and Xiaoyu Wang},
journal= {arXiv preprint arXiv:2203.03952},
year = {2022}
}
备注
This paper has been acccpted by ECCV 2022. Code is available at https://github.com/hkzhang91/ParC-Net