GhostNetV3:探索紧凑模型的训练策略
计算机视觉与模式识别
2024-04-23 v2
摘要
紧凑型神经网络专门设计用于边缘设备上的应用,具有更快的推理速度但性能适中。然而,紧凑模型的训练策略目前是从传统模型中借用的,忽略了它们在模型容量上的差异,因此可能阻碍紧凑模型的性能。在本文中,通过系统研究不同训练成分的影响,我们为紧凑模型引入了一种强大的训练策略。我们发现,重新参数化和知识蒸馏的适当设计对于训练高性能紧凑模型至关重要,而一些用于训练传统模型的常用数据增强方法,如Mixup和CutMix,会导致性能下降。我们在ImageNet-1K数据集上的实验表明,我们针对紧凑模型的专门训练策略适用于各种架构,包括GhostNetV2、MobileNetV2和ShuffleNetV2。具体来说,采用我们的策略,GhostNetV3 1.3×在移动设备上仅用269M FLOPs和14.46ms延迟就达到了79.1%的top-1准确率,大大超过了其普通训练的对等模型。此外,我们的观察也可以扩展到目标检测场景。PyTorch代码和检查点可在https://github.com/huawei-noah/Efficient-AI-Backbones/tree/master/ghostnetv3_pytorch找到。
引用
@article{arxiv.2404.11202,
title = {GhostNetV3: Exploring the Training Strategies for Compact Models},
author = {Zhenhua Liu and Zhiwei Hao and Kai Han and Yehui Tang and Yunhe Wang},
journal= {arXiv preprint arXiv:2404.11202},
year = {2024}
}