中文

Preserve-Then-Quantize:在 LLM 中用于量化误差重构的秩预算平衡

机器学习 2026-05-14 v2 人工智能

摘要

量化误差重构(QER)通过近似权重 WQ+LR\mathbf{W} \approx \mathbf{Q} + \mathbf{L}\mathbf{R} 来减少后训练量化(PTQ)中的精度损失,使用秩为 rr 的校正来重构量化误差。先前方法将全部秩预算用于误差重构,当 W\mathbf{W} 具有内在低秩结构且量化破坏了主导方向时,这种做法并不优化。我们提出了结构化残差重构(SRR),这是一种秩分配框架,旨在在量化前保留激活缩放权重的前 kk 个奇异子空间,仅对残差进行量化,并使用剩余的秩 rkr-k 用于误差重构。我们推导出一种理论导向的准则,用于选择 kk,以在秩约束下平衡量化暴露的能量与不可恢复的误差。我们进一步表明, resulting Q+LR\mathbf{Q} + \mathbf{L}\mathbf{R} 参数化自然支持量化参数高效微调(QPEFT),并通过沿保留方向的梯度缩放来稳定微调。在实验中,我们在各种模型和量化设置下实现了持续的困惑度降低,并在 2 位 QPEFT 下在 GLUE 上获得了 5.9 个百分点的平均提升。项目页面可在 https://ai-isl.github.io/srr 查看。

关键词

引用

@article{arxiv.2602.02001,
  title  = {Preserve-Then-Quantize: Balancing Rank Budgets for Quantization Error Reconstruction in LLMs},
  author = {Yoonjun Cho and Dongjae Jeon and Soeun Kim and Moongyu Jeon and Albert No},
  journal= {arXiv preprint arXiv:2602.02001},
  year   = {2026}
}

备注

Accepted at ICML 2026. Project page: https://ai-isl.github.io/srr