中文

打破积木:连续低秩分解标量用于统一 LLM 量化与适应

机器学习 2026-02-02 v1 人工智能

摘要

当前 LLM 的量化方法主要依赖块状结构以保持效率,往往以牺牲表征灵活性为代价。本文演示,通过将标量模型化为连续低秩矩阵(S=BAS = BA),元素级量化可与块级标量保持相同的效率,同时提供严格更优的表达能力。我们提出低秩分解标量(LoRDS),一个重新思考量化粒度的统一框架。通过“打破”空间约束,LoRDS 建立了无缝的效率生命周期:它提供高保真 PTQ 初始化,通过迭代优化进行细化,使量化感知训练(QAT)能够同时作用于权重和标量因子,并支持高秩乘性 PEFT 适应。与 QLoRA 等加法 PEFT 方法不同,LoRDS 能在低秩预算内实现高秩权重更新,同时无需额外的推理开销。基于高度优化的 Triton 内核,LoRDS 在 various 模型家族中在量化和下游微调任务上 consistently 超过最先进的基线。值得注意的是,在 Llama3-8B 上,我们的方法在 3 位比正常浮点数量化(NormalFloat)实现最高可达 27.0% 的准确率提升,并在 NVIDIA RTX 4090 上实现 1.5 倍的推理加速,同时在下游任务上相较于 4 位 QLoRA 提升 9.6% 的 PEFT 性能,为 LLM 的统一压缩与适应提供了稳健且集成的解决方案。

关键词

引用

@article{arxiv.2601.22716,
  title  = {Breaking the Blocks: Continuous Low-Rank Decomposed Scaling for Unified LLM Quantization and Adaptation},
  author = {Pingzhi Tang and Ruijie Zhou and Fanxu Meng and Wenjie Pei and Muhan Zhang},
  journal= {arXiv preprint arXiv:2601.22716},
  year   = {2026}
}