中文

BASE-Q:面向大语言模型的双向偏置与非线性比例增强旋转量化

机器学习 2025-09-01 v2 人工智能 计算与语言

摘要

旋转技术已成为大语言模型(LLM)量化流水线中的关键技术,通过有效平滑权重和激活中的离群值。然而,进一步优化旋转参数仅能获得有限的性能提升,却引入显著的计算开销:由于旋转参数共享,必须同时加载完整模型才能实现反向传播,从而导致大量内存消耗并限制实际应用。本文指出当前旋转量化方法的两个根本局限:(i) 旋转未能对齐通道均值,导致量化范围更宽、四舍五入误差增大;(ii) 旋转使激活分布更接近高斯分布,增加因裁剪误差导致的能量损失。为此,我们提出BASE-Q,一种简单而强大的方法,通过偏置校正和非线性比例缩放有效减少四舍五入和裁剪误差。此外,BASE-Q支持块级优化,无需高昂的全模型反向传播。广泛的实验在各种LLM和基准测试上表明BASE-Q的有效性,使其与QuaRot、SpinQuant和OSTQuant相比,分别将与全精度模型的精度差距缩小至50.5%、42.9%和29.2%。代码将很快公开。

关键词

引用

@article{arxiv.2506.15689,
  title  = {BASE-Q: Bias and Asymmetric Scaling Enhanced Rotational Quantization for Large Language Models},
  author = {Liulu He and Shenli Zheng and Karwei Sun and Yijiang Liu and Yufei Zhao and Chongkang Tan and Huanrui Yang and Yuan Du and Li Du},
  journal= {arXiv preprint arXiv:2506.15689},
  year   = {2025}
}