QuantLRM:基于微调信号对大推理模型进行量化
机器学习
2026-02-04 v1 人工智能
摘要
权重级量化对于压缩大型语言模型 (LLM) 至为重要。受经典幅度剪枝精神启发,我们研究在推理激励式微调期间权重更新的幅度是否为量化大型推理模型 (LRM) 提供有价值信号。我们假设:在微调期间最小和最大权重更新比中间幅度的更新更重要,这一现象我们称为“双端保护”。在假设验证后,我们提出 QuantLRM,即通过微调信号对 LRM 进行权重量化的方法。我们对权重更新拟合受限二次函数以保护双端。通过将平均二次值乘以通道零权重更新计数,我们计算出比使用激活或二阶信息更有效的通道重要性。我们对各种微调模型(包括监督式、直接偏好优化和强化学习微调)进行 QuantLRM 量化,测试于四个推理基准(AIME-120、FOLIO、时序序列和 GPQA-Diamond),经验发现 QuantLRM 对 LRM 量化 consistently 提升性能,在强化学习微调模型上平均提升 6.55%。同时支持非微调的 LRM,QuantLRM 通过伪微调获取有效信号,大幅提升其适用性。
引用
@article{arxiv.2602.02581,
title = {QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals},
author = {Nan Zhang and Eugene Kwek and Yusen Zhang and Muyu Pan and Suhang Wang and Prasenjit Mitra and Rui Zhang},
journal= {arXiv preprint arXiv:2602.02581},
year = {2026}
}