RapidNet: 基于多层扩张卷积的移动端骨干网络
计算机视觉与模式识别
2024-12-17 v1 人工智能
摘要
视觉Transformer(ViTs)近年来主导了计算机视觉领域。然而,ViTs 计算代价高且不适合移动设备,这导致了卷积神经网络(CNN)和基于 ViT 的混合模型在移动视觉应用中的普及。最近,基于视觉图神经网络(ViG)和 CNN 的混合模型也被提出用于移动视觉任务。然而,所有这些方法仍然比纯 CNN 模型慢。在本工作中,我们提出多层扩张卷积来设计一种纯 CNN 驱动的移动端骨干网络。使用多层扩张卷积可以获得比标准卷积更大的理论感受野。不同层级的扩张也允许图像中短程和长程特征之间的交互。实验表明,我们提出的模型在图像分类、目标检测、实例分割和语义分割方面,在准确性和/或速度上均优于最先进的(SOTA)移动端 CNN、ViT、ViG 和混合架构。我们的最快模型 RapidNet-Ti 在 ImageNet-1K 上实现了 76.3% 的 top-1 准确率,在 iPhone 13 mini NPU 上推理延迟为 0.9 毫秒,比 MobileNetV2x1.4(74.7% top-1,1.0 毫秒延迟)更快更准确。我们的研究表明,通过合理设计,纯 CNN 架构可以在准确性和速度上击败 SOTA 混合模型和 ViT 模型。
引用
@article{arxiv.2412.10995,
title = {RapidNet: Multi-Level Dilated Convolution Based Mobile Backbone},
author = {Mustafa Munir and Md Mostafijur Rahman and Radu Marculescu},
journal= {arXiv preprint arXiv:2412.10995},
year = {2024}
}
备注
Accepted in 2025 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2025)