OTOV2:自动、通用、用户友好
摘要
现有通过结构化剪枝的模型压缩方法通常需要复杂的多阶段流程。每个独立阶段都需要大量工程投入与来自终端用户的领域知识,这阻碍了它们在更广泛场景中的应用。我们提出第二代“仅训练一次”(Only-Train-Once,OTOv2),它首次自动地从零开始仅训练并压缩一个通用 DNN 一次,以产生具有竞争力性能且更紧凑的模型,无需微调。OTOv2 是自动化的并可插入各种深度学习应用中,且几乎不需要用户的工程投入。在方法上,OTOv2 提出两项主要改进:(i)自主性:自动挖掘通用 DNN 的依赖关系,将可训练变量划分为零不变组(Zero-Invariant Groups,ZIGs),并构建压缩模型;(ii)双半空间投影梯度(Dual Half-Space Projected Gradient,DHSPG):一种能更可靠求解结构化稀疏问题的新型优化器。在数值上,我们在 VGG、ResNet、CARN、ConvNeXt、DenseNet 和 StackedUnets 等多种模型架构上展示了 OTOv2 的通用性与自主性,其中大多数架构若无非大量手工定制则无法被其他方法处理。结合 CIFAR10/100、DIV2K、Fashion-MNIST、SVNH 和 ImageNet 等基准数据集,其有效性通过具有竞争力甚至优于最先进方法的表现得到验证。源代码发布于 https://github.com/tianyic/only_train_once。
引用
@article{arxiv.2303.06862,
title = {OTOV2: Automatic, Generic, User-Friendly},
author = {Tianyi Chen and Luming Liang and Tianyu Ding and Zhihui Zhu and Ilya Zharkov},
journal= {arXiv preprint arXiv:2303.06862},
year = {2023}
}
备注
Published on ICLR 2023. Remark here that a few images of dependency graphs can not be included in arXiv due to exceeding size limit