面向高效神经网络训练与压缩的自动联合结构化剪枝与量化
机器学习
2025-02-25 v1 人工智能
计算机视觉与模式识别
摘要
结构化剪枝和量化是用于缩小深度神经网络(DNN)大小的基本技术,通常独立应用。通过联合 co-optimization 应用这些技术有望产生更小的高质量模型。然而,现有的联合方案因 (1) 工程困难(复杂的多阶段流程)、(2) 黑箱优化(需 extensive hyperparameter 调优以控制整体压缩)和 (3) 足够的架构泛化性不足而未得到广泛使用。为解决这些限制,我们提出了 GETA 框架,该框架自动且高效地对任意 DNN 进行联合结构化剪枝和量化感知训练。GETA 引入了三个关键创新:(i) 量化感知依赖图(QADG),用于构建通用量化感知 DNN 的剪枝搜索空间;(ii) 部分投影随机梯度法,确保层级位约束被满足;(iii) 一种新的联合学习策略,融合了剪枝与量化之间的可解释关系。我们在卷积神经网络和 Transformer 架构上进行数值实验,表明该方法在与现有联合剪枝和量化方法相比时,实现了具有竞争力(常常更优)的性能。
引用
@article{arxiv.2502.16638,
title = {Automatic Joint Structured Pruning and Quantization for Efficient Neural Network Training and Compression},
author = {Xiaoyi Qu and David Aponte and Colby Banbury and Daniel P. Robinson and Tianyu Ding and Kazuhito Koishida and Ilya Zharkov and Tianyi Chen},
journal= {arXiv preprint arXiv:2502.16638},
year = {2025}
}