OTOv3:从结构化剪枝到擦除算子的自动架构无关神经网络训练与压缩
机器学习
2023-12-18 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
将预定义的深度神经网络(DNN)压缩为具有竞争性能的紧凑子网络,在高效机器学习领域至关重要。该主题涵盖从结构化剪枝到神经架构搜索的各种技术,包含剪枝和擦除算子两方面视角。尽管有进展,现有方法受限于复杂、多阶段过程,需要大量工程与领域知识,限制了其更广泛应用。我们引入第三代 Only-Train-Once (OTOv3),它首次通过剪枝和擦除操作自动训练并压缩通用 DNN,无需微调即创建紧凑且具竞争性的子网络。OTOv3 简化并自动化训练与压缩过程,最小化用户所需工程投入。它提供关键技术进展:(i) 基于依赖图分析的通用 DNN 自动搜索空间构建;(ii) 双半空间投影梯度(DHSPG)及其带分层搜索的增强版本(H2SPG),以可靠求解(分层)结构化稀疏问题并确保子网络有效性;以及(iii) 利用 DHSPG/H2SPG 的解与依赖图自动构建子网络。我们的实证结果证明了 OTOv3 在结构化剪枝与神经架构搜索各种基准上的有效性。OTOv3 产生的子网络匹配或超越 SOTA。源代码将提供于 https://github.com/tianyic/only_train_once。
引用
@article{arxiv.2312.09411,
title = {OTOv3: Automatic Architecture-Agnostic Neural Network Training and Compression from Structured Pruning to Erasing Operators},
author = {Tianyi Chen and Tianyu Ding and Zhihui Zhu and Zeyu Chen and HsiangTao Wu and Ilya Zharkov and Luming Liang},
journal= {arXiv preprint arXiv:2312.09411},
year = {2023}
}
备注
39 pages. Due to the page dim limitation, the full appendix is attached here https://tinyurl.com/otov3appendix. Recommend to zoom-in for finer details. arXiv admin note: text overlap with arXiv:2305.18030