RepNeXt:一种使用结构重参数化的快速多尺度卷积神经网络
计算机视觉与模式识别
2024-07-23 v2
摘要
在资源受限的移动视觉任务领域,对效率和性能的追求持续推动着轻量级卷积神经网络(CNN)和视觉Transformer(ViT)的创新。虽然ViT通过自注意力机制在捕捉全局上下文方面表现出色,但它们在资源受限环境中的部署受到计算复杂度和延迟的阻碍。相比之下,轻量级CNN因其参数效率和低延迟而受到青睐。本研究探索了CNN和ViT的互补优势,以开发一种适用于资源受限应用的通用视觉骨干网络。我们引入了RepNeXt,这是一个新颖的模型系列,它整合了多尺度特征表示,并结合了串行和并行结构重参数化(SRP),以在不影响推理速度的情况下增强网络深度和宽度。大量实验表明,RepNeXt在多种视觉基准测试中优于当前领先的轻量级CNN和ViT,并具有有利的延迟。RepNeXt-M4在iPhone 12上以1.5毫秒的延迟在ImageNet上达到了与RepViT-M1.5相同的82.3%的准确率,在MS-COCO上其AP高出1.3,并且参数减少了0.7M。代码和模型可在https://github.com/suous/RepNeXt获取。
引用
@article{arxiv.2406.16004,
title = {RepNeXt: A Fast Multi-Scale CNN using Structural Reparameterization},
author = {Mingshu Zhao and Yi Luo and Yong Ouyang},
journal= {arXiv preprint arXiv:2406.16004},
year = {2024}
}
备注
Tech report; added general view of the operations and convnext ablation experiments