Fast-ParC:为 ConvNets 与 ViTs 捕获位置感知的全局特征
计算机视觉与模式识别
2023-12-01 v2
摘要
近年来,Transformer 模型在各个领域取得了巨大进展。在计算机视觉领域,视觉 Transformer(ViTs)也成为卷积神经网络(ConvNets)的有力替代,但尚无法取代 ConvNets,因为二者各有优势。例如,ViTs 善于通过注意力机制提取全局特征,而 ConvNets 凭借强归纳偏置在建模局部关系上更高效。一个自然的想法是结合 ConvNets 与 ViTs 的优势来设计新结构。本文中,我们提出一种名为位置感知循环卷积(ParC)及其加速版本 Fast-ParC 的新型基础神经网络算子。ParC 算子通过使用全局核与循环卷积捕获全局特征,同时利用位置嵌入保持位置敏感性。我们的 Fast-ParC 进一步利用快速傅里叶变换将 ParC 的 O(n2) 时间复杂度降至 O(n log n)。该加速使得在具有大特征图的模型早期阶段使用全局卷积成为可能,且仍使整体计算成本与使用 3x3 或 7x7 核相当。所提操作可以即插即用的方式用于:1) 将 ViTs 转换为纯 ConvNet 架构以享受更广泛的硬件支持并实现更高推理速度;2) 替换 ConvNets 深层中的传统卷积,通过扩大有效感受野提升精度。实验结果表明,我们的 ParC 算子能有效扩大传统 ConvNets 的感受野,且采用所提算子有益于 ViTs 与 ConvNet 模型在全部三个流行视觉任务——图像分类、目标
引用
@article{arxiv.2210.04020,
title = {Fast-ParC: Capturing Position Aware Global Feature for ConvNets and ViTs},
author = {Tao Yang and Haokui Zhang and Wenze Hu and Changwen Chen and Xiaoyu Wang},
journal= {arXiv preprint arXiv:2210.04020},
year = {2023}
}
备注
22 pages, 8 figures, 10 tables. A preliminary version of this paper has been published in ECCV 2022 and it can be find in arXiv:2203.03952