基于典型情形分析的权重量化对学习模型的影响
机器学习
2024-01-31 v1 机器学习
摘要
本文研究了大规模数据分析模型中使用的量化方法及其超参数选择。近年来,数据分析规模的激增显著增加了对计算资源的需求。为了解决这个问题,量化模型权重已成为深度学习等数据分析应用中的普遍做法。对于在计算资源有限的设备上部署大型模型,量化尤为关键。然而,量化超参数的选择,例如权重量化的比特数和取值范围,仍然是一个探索不足的领域。在本研究中,我们采用统计物理学的典型情形分析,特别是副本方法,来探索超参数对简单学习模型量化的影响。我们的分析得出了三个关键发现:(i)当比特数较少且量化宽度较大时,会出现一个不稳定的超参数相,即副本对称性破缺;(ii)存在一个使误差最小化的最优量化宽度;(iii)量化延迟了过参数化的开始,有助于缓解由双下降现象所指示的过拟合。我们还发现非均匀量化可以增强稳定性。此外,我们开发了一种近似消息传递算法来验证我们的理论结果。
引用
@article{arxiv.2401.17269,
title = {Effect of Weight Quantization on Learning Models by Typical Case Analysis},
author = {Shuhei Kashiwamura and Ayaka Sakata and Masaaki Imaizumi},
journal= {arXiv preprint arXiv:2401.17269},
year = {2024}
}