超极量化的多信封双二进制因子分解
机器学习
2026-01-01 v1 人工智能
计算与语言
机器学习
摘要
对于大型语言模型 (LLM) 的极端低位量化,双二进制因子分解 (DBF) 因其能够在不牺牲精度的前提下实现高效推理而具吸引力。然而,DBF 的缩放参数过于限制性;在分解符号后,所有秩分量共享相同的幅度轮廓,导致性能饱和。我们提出了多信封 DBF (MDBF),保留共享的一对 1 位符号基底,取代单一信封为秩- 信封。通过在信封组件之间共享符号矩阵,MDBF 有效地保持二进制载体,并在有限的内存预算内利用局限的存储空间来实现幅度表达性。我们还引入了闭式初始化和交替细化方法以优化 MDBF。在 LLaMA 和 Qwen 系列模型上,MDBF 在每权重位数匹配的前提下,显著优于以往的二进制格式在困惑度和零样本准确率方面,同时保持相同的部署友好推理原语。
引用
@article{arxiv.2512.24545,
title = {More Than Bits: Multi-Envelope Double Binary Factorization for Extreme Quantization},
author = {Yuma Ichikawa and Yoshihiko Fujisawa and Yudai Fujimoto and Akira Sakai and Katsuki Fujisawa},
journal= {arXiv preprint arXiv:2512.24545},
year = {2026}
}
备注
14 pages, 2 figures