统一均匀与二进制编码量化:精准压缩大型语言模型
计算与语言
2025-06-17 v2
摘要
我们如何在保持精度的同时对大型语言模型进行量化?量化对于高效部署大型语言模型(LLM)至关重要。二进制编码量化(BCQ)和均匀量化(UQ)是两种具有强表达性和可优化性的有前景的量化方案。然而,两种方案都未能同时发挥两者的优势。本文提出了 UniQuanF(统一量化与灵活映射),一种用于 LLM 的准确量化方法。UniQuanF 通过统一 UQ 中的灵活映射技术和 BCQ 中的非均匀量化层级,发挥了强大的表达性和可优化性。我们提出了统一初始化、局部和周期性映射技术,以精确优化 UniQuanF 中的参数。经过优化后,我们的统一定理消除了计算和内存开销,使我们能够在无需额外部署成本的前提下利用 UniQuanF 的卓越精度。实验结果表明,UniQuanF 在 GSM8K 基准测试中超越现有 UQ 和 BCQ 方法,准确率提升最高可达 4.60%。
引用
@article{arxiv.2506.03781,
title = {Unifying Uniform and Binary-coding Quantization for Accurate Compression of Large Language Models},
author = {Seungcheol Park and Jeongin Bae and Beomseok Kwon and Minjun Kim and Byeongwook Kim and Se Jung Kwon and U Kang and Dongsoo Lee},
journal= {arXiv preprint arXiv:2506.03781},
year = {2025}
}
备注
ACL 2025 Main Track