中文

MSQ:内存高效的位稀疏量化

机器学习 2025-07-31 v1

摘要

随着深度神经网络 (DNN) 在移动和边缘设备上的部署增加,优化模型效率变得至关重要。混合精度量化广受青睐,因为其在效率和准确性之间提供了优越的平衡。然而,寻找每个层的最优精度具有挑战性。最近的研究利用位级稀疏性显示出前景,但通常会引入巨大的训练复杂度和高 GPU 内存要求。本文提出 Memory-Efficient Bit Sparsification Quantization (MSQ),一种新方法,旨�解决这些限制。MSQ 对 least significant bits (LSBs) 应用 round-clamp 量化器,实现其可微计算。进一步采用正则化诱导这些 LSBs 的稀疏性,从而在无需显式位级参数分裂的情况下实现有效的精度降低。此外,MSQ 整合 Hessian 信息,允许同时修剪多个 LSBs 以进一步提升训练效率。实验结果表明,MSQ 在可训练参数上实现最高 8.00 倍的减少,在训练时间上实现最高 86% 的减少,同时保持具竞争力的准确性和压缩率。这使其成为在资源受限设备上训练高效 DNN 的实用解决方案。

关键词

引用

@article{arxiv.2507.22349,
  title  = {MSQ: Memory-Efficient Bit Sparsification Quantization},
  author = {Seokho Han and Seoyeon Yoon and Jinhee Kim and Dongwei Wang and Kang Eun Jeon and Huanrui Yang and Jong Hwan Ko},
  journal= {arXiv preprint arXiv:2507.22349},
  year   = {2025}
}