中文

窄化 ConvNeXt:高效多设备部署的宽度自适应推理

计算机视觉与模式识别 2026-05-22 v1

摘要

在资源约束条件不同的设备之间部署视觉模型,甚至在单个设备上当可用计算因电池状态、热节流或延迟限制而变化时,通常需要训练和维护多个独立模型。宽度自适应推理通过训练单一的权重集合,包含多个递增容量的嵌套子网络,从而实现这一目标。但以前的基于 CNN 的方法需要可切换的 batch normalization,而近期可扩展的方法则聚焦于 Vision Transformer。我们提出了 Slimmable ConvNeXt,展示了 ConvNeXt 的现代设计(特别是 LayerNorm 和 inverted bottlenecks)特别适合进行通道宽度窄化,从而消除了经典窄化网络的归一化开销,使训练流程比以前的 CNN 和 ViT 方法更简单。在 ImageNet-1k 上,Slimmable ConvNeXt-T 具有 3 个子网络,实现了在 4.5 GMACs 上的 80.8% Top-1 准确率,在 1.2 GMACs 上的 77.4% 准确率,训练自 600 个 epoch。在相当相同的计算资源下,这超过了 HydraViT 的 6 头子网络(78.4% 在 4.6 GMACs)和 3 头配置(73.0% 在 1.3 GMACs)每项提升 2.4 和 4.4 个百分点,同时也优于 MatFormer-S(78.6%)和 SortedNet-S(78.2%)。进一步扩展到 Slimmable ConvNeXt-B 可将最大准确率提升至 82.8%,对应 15.35 GMACs。

关键词

引用

@article{arxiv.2605.22677,
  title  = {Slimmable ConvNeXt: Width-Adaptive Inference for Efficient Multi-Device Deployment},
  author = {Janek Haberer and Jon Eike Wilhelm and Olaf Landsiedel},
  journal= {arXiv preprint arXiv:2605.22677},
  year   = {2026}
}

备注

Accepted at Mobile AI Workshop 2026 (CVPR'26 Workshop)