中文

BWLA:突破LLM后训练量化中W1AX的瓶颈

机器学习 2026-05-04 v1 人工智能

摘要

大型语言模型(LLM)推动了自然语言处理领域取得重大进展,但其巨大的内存和计算需求仍阻碍了实际部署。二值化可将权重压缩至1位,从根本上降低计算和带宽成本。然而,现有方法无法解决激活值重尾问题,必须保持激活值的高精度,从而无法实现真正的端到端加速。为克服这一限制,我们提出了BWLA(Binarized Weights and Low-bit Activations),这是一种首次实现高精度保持的后训练量化框架,实现1位权重量化并支持低位激活(例如6位)。正交-克罗内克变换(OKT)通过EM最小化学习正交映射,将单模态权重转换为对称双模态形式,同时抑制激活重尾和不相关性。接近SVD投影(PSP) then performs lightweight low-rank refinement through proximal SVD projection, further enhancing quantizability with minimal overhead. 在Qwen3-32B模型上,BWLA实现了11.92的WikiText2困惑度(6位激活,较SOTA提升26.08),在五个零样本任务上提升超过70%,并实现3.26倍的推理加速,展示了强大的实际LLM压缩和加速潜力。

关键词

引用

@article{arxiv.2605.00422,
  title  = {BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMs},
  author = {Zhixiong Zhao and Zukang Xu and Dawei Yang},
  journal= {arXiv preprint arXiv:2605.00422},
  year   = {2026}
}

备注

Accepted by ACL-Main 2026