起始位置很重要:神经网络量化中更好权重初始化的研究
摘要
深度神经网络(DNN)量化以实现快速高效推理一直是限制机器学习(ML)模型推理成本的重要工具。正则化、量化感知训练和量化鲁棒性惩罚等量化特定的模型开发技术已大大提升了现代DNN的准确性和鲁棒性。然而,针对量化的DNN训练初始条件的改进探索非常有限。正如随机权重初始化已被证明会显著影响浮点模型的测试准确率一样,不同的权重初始化方法也会影响训练模型的量化鲁棒性。我们进行了一项广泛的研究,考察了不同权重初始化对高效CNN中常用CNN构建块的影响。该分析揭示,即使CNN架构各异,随机权重初始化器的选择也会显著影响最终的量化鲁棒性。接下来,我们探索了一种新的量化鲁棒CNN初始化方法——使用图超网络(GHN)来预测量化DNN的参数。除了表明GHN预测的参数在常规float32预训练后具有量化鲁棒性外,我们还发现对GHN进行微调以预测量化图的参数(我们称之为GHN-QAT)可以进一步提升CNN的量化准确率。值得注意的是,GHN-QAT即使在4位量化下也表现出显著的准确率提升,在2位量化下优于随机初始化。据我们所知,这是首次对量化感知DNN权重初始化进行的深入研究。GHN-QAT为量化DNN模型设计提供了一种新方法。未来研究,如使用GHN-QAT初始化的参数进行量化感知训练,可以进一步简化DNN量化流程。
引用
@article{arxiv.2506.10463,
title = {Starting Positions Matter: A Study on Better Weight Initialization for Neural Network Quantization},
author = {Stone Yun and Alexander Wong},
journal= {arXiv preprint arXiv:2506.10463},
year = {2025}
}
备注
Portions of this article have been presented as extended abstracts at the ICCV 2023 Workshop on Low Bit Quantized Neural Networks (ICCVW-LBQNN 2023) and the 2020 Conference on Vision and Intelligent Systems (CVIS 2020). arXiv admin note: text overlap with arXiv:2011.14578, arXiv:2208.12489, arXiv:2309.13773