D{\epsilon}pS:用于更快一次性训练的延迟{\epsilon}-缩小
计算机视觉与模式识别
2024-07-09 v1 机器学习
摘要
CNN在不同硬件、动态环境和低功耗嵌入式设备上的部署日益增多。这导致设计和训练CNN架构的目标是满足此类可变部署约束条件,最大化准确率。随着部署场景的不断增长,发现可扩展解决方案来设计和训练专用CNN的需求日益迫切。一次性训练已成为一种可扩展的方法,通过恒定的训练成本同时共训练许多模型(子网),并在之后找到专用CNN。通过对完整模型进行训练并同时将其缩小为更小的子网来实现可扩展性,这些子网共享模型权重(weight-shared shrinking)。然而,现有的一次性训练方法的训练成本高达1200 GPU小时。我们认为这可能是因为它们要么过早要么过晚地开始缩小完整模型的过程。因此,我们提出了延迟{\epsilon}-缩小(DpS),该方法在模型部分训练完成时(~50%)开始缩小过程,从而实现训练成本的改善以及更好的原位知识蒸馏到更小的模型。该方法还包括动态调整子网学习率的新型启发式方法(E),从而提高了从更大子网到更小子网的weight-shared知识蒸馏。结果显示,DEpS在包括CIFAR10/100、ImageNet-100和ImageNet-1k在内的不同数据集上在准确率和成本方面均优于最先进的一次性训练技术。它在ImageNet-1k上实现了1.83%更高的top1准确率,或以相同准确率下降1.3倍的FLOPs和2.5倍的训练成本(GPU*hrs)。
引用
@article{arxiv.2407.06167,
title = {D{\epsilon}pS: Delayed {\epsilon}-Shrinking for Faster Once-For-All Training},
author = {Aditya Annavajjala and Alind Khare and Animesh Agrawal and Igor Fedorov and Hugo Latapie and Myungjin Lee and Alexey Tumanov},
journal= {arXiv preprint arXiv:2407.06167},
year = {2024}
}
备注
Accepted to the 18th European Conference on Computer Vision (ECCV 2024)