中文

decoupleQ:通过将参数解耦为整数与浮点数实现 2 比特训练后均匀量化

机器学习 2024-04-22 v1

摘要

近年来,量化已成为部署高效大型模型以用于各种实时应用的最具前景的压缩技术之一。考虑到权重的存储与 IO 占据了大型模型内部开销的绝大部分,仅权重量化即可带来巨大收益。然而,现有的量化方案在极低比特下会遭受显著的精度下降,或在部署时需要额外的计算开销,难以应用于工业界的大规模场景。本文提出 decoupleQ,实现了模型精度的显著提升,尤其是在极低比特下。decoupleQ 摒弃了传统的启发式量化范式,将模型参数解耦为整数部分和浮点数部分,从而将量化问题转化为带约束的传统数学优化问题,并使用现成的优化方法交替求解。通过 decoupleQ 进行的量化是线性且均匀的,使其比非均匀量化更利于硬件实现,并使该思想能够迁移至高比特量化以增强其鲁棒性。我们的方法在字节跳动大型语音模型的 2 比特量化中取得了接近 fp16/bf16 的良好在线精度。代码可在 https://github.com/bytedance/decoupleQ 获取

关键词

引用

@article{arxiv.2404.12759,
  title  = {decoupleQ: Towards 2-bit Post-Training Uniform Quantization via decoupling Parameters into Integer and Floating Points},
  author = {Yi Guo and Fanliu Kong and Xiaoyang Li and Hui Li and Wei Chen and Xiaogang Tian and Jinping Cai and Yang Zhang and Shouda Liu},
  journal= {arXiv preprint arXiv:2404.12759},
  year   = {2024}
}

备注

quantization for deep models