中文

CBQ:面向大型语言模型的跨块量化

机器学习 2025-02-26 v5 计算与语言

摘要

训练后量化(PTQ)在以超低成本压缩大型语言模型(LLM)方面发挥了关键作用。然而,现有的PTQ方法仅专注于处理一层或一个块内的异常值,这忽略了块之间的依赖性,并导致在低位设置下性能严重下降。在本文中,我们提出了CBQ,一种基于跨块重建的LLM PTQ方法。CBQ通过同源重建方案利用跨块依赖性,建立跨多个块的长程依赖关系以最小化误差累积。此外,CBQ结合了用于抑制权重和激活异常值的粗到细预处理(CFP)策略,以及用于精确权重量化的自适应LoRA-Rounding技术。这些创新使CBQ不仅能够有效处理极端异常值,还能提高整体量化精度。大量实验表明,CBQ实现了优越的低位量化(W4A4、W4A8、W2A16),并在各种LLM和数据集上优于现有的最先进方法。值得注意的是,CBQ在单个GPU上仅在4.3小时内量化了4位LLAMA1-65B模型,在性能和量化效率之间实现了值得称赞的权衡。

关键词

引用

@article{arxiv.2312.07950,
  title  = {CBQ: Cross-Block Quantization for Large Language Models},
  author = {Xin Ding and Xiaoyu Liu and Zhijun Tu and Yun Zhang and Wei Li and Jie Hu and Hanting Chen and Yehui Tang and Zhiwei Xiong and Baoqun Yin and Yunhe Wang},
  journal= {arXiv preprint arXiv:2312.07950},
  year   = {2025}
}