部分卷积融合视觉注意力
计算机视觉与模式识别
2025-03-06 v1 人工智能
摘要
设计高效且有效的神经网络结构仍是计算机视觉领域的热门话题。深度可分离卷积 (DWConv) 在高效 CNN 或 ViT 中广泛应用,但在推理过程中需要频繁访问内存,导致吞吐量较低。FasterNet 试图引入部分卷积 (PConv) 作为 DWConv 的替代方案,但由于通道利用不充分,导致精度下降。为弥补这一不足并考虑特征图通道之间的冗余性,我们引入一种新的部分视觉注意力机制 (PAT),高效地将 PConv 与视觉注意力结合。我们的探索表明,部分注意力机制可完全取代全注意力机制,从而减少模型参数和 FLOPs。我们的 PAT 可派生出三类模块:部分通道注意力模块 (PAT_ch)、部分空间注意力模块 (PAT_sp) 和部分自注意力模块 (PAT_sf)。首先,PAT_ch 将增强的高斯通道注意力机制整合到 PConv 的未触及通道中,以注入全局分布信息。其次,我们引入空间注意力机制到 MLP 层,以进一步提升模型精度。最后,我们将最后一个阶段的 PAT_ch 替换为自注意力机制,以扩展全局感受野。基于 PAT,我们提出一种新型混合网络系列,命名为 PATNet,该网络在 ImageNet-1K 分类任务中实现了优于 FasterNet 的更高 top-1 精度和更快的推理速度,并在 COCO 数据集上的检测和分割任务中表现优异。特别地,PATNet-T2 相比 FasterNet-T2 的准确率提高 1.3%,而 GPU 吞吐量提高 25%,CPU 延迟降低 24%。
引用
@article{arxiv.2503.03148,
title = {Partial Convolution Meets Visual Attention},
author = {Haiduo Huang and Fuwei Yang and Dong Li and Ji Liu and Lu Tian and Jinzhang Peng and Pengju Ren and Emad Barsoum},
journal= {arXiv preprint arXiv:2503.03148},
year = {2025}
}
备注
arXiv admin note: substantial text overlap with arXiv:2502.01303