Preserve-Then-Quantize:在 LLM 中用于量化误差重构的秩预算平衡
机器学习
2026-05-14 v2 人工智能
摘要
量化误差重构(QER)通过近似权重 来减少后训练量化(PTQ)中的精度损失,使用秩为 的校正来重构量化误差。先前方法将全部秩预算用于误差重构,当 具有内在低秩结构且量化破坏了主导方向时,这种做法并不优化。我们提出了结构化残差重构(SRR),这是一种秩分配框架,旨在在量化前保留激活缩放权重的前 个奇异子空间,仅对残差进行量化,并使用剩余的秩 用于误差重构。我们推导出一种理论导向的准则,用于选择 ,以在秩约束下平衡量化暴露的能量与不可恢复的误差。我们进一步表明, resulting 参数化自然支持量化参数高效微调(QPEFT),并通过沿保留方向的梯度缩放来稳定微调。在实验中,我们在各种模型和量化设置下实现了持续的困惑度降低,并在 2 位 QPEFT 下在 GLUE 上获得了 5.9 个百分点的平均提升。项目页面可在 https://ai-isl.github.io/srr 查看。
引用
@article{arxiv.2602.02001,
title = {Preserve-Then-Quantize: Balancing Rank Budgets for Quantization Error Reconstruction in LLMs},
author = {Yoonjun Cho and Dongjae Jeon and Soeun Kim and Moongyu Jeon and Albert No},
journal= {arXiv preprint arXiv:2602.02001},
year = {2026}
}
备注
Accepted at ICML 2026. Project page: https://ai-isl.github.io/srr