中文

基于后量化积分识别敏感权重

机器学习 2025-03-05 v1 人工智能

摘要

为大型语言模型 (LLM) 提供服务成本高昂。然而,后训练权重量化可通过压缩其规模以适应有限内存以及节省带宽实现加速。由于并非所有权重维度都同样重要,这些方法通常依赖敏感度度量指标,以指示权重元素对损失函数的影响,用于预处理原始权重以获得更好的量化。在本工作中,我们对敏感度度量的准确性进行了实证研究,发现现有的梯度和 Hessian 基于度量非常不准确:它们主要由于局部二阶近似(即梯度和 Hessian 项在 Taylor 公式中的贡献)收敛半径较小,严重低估了量化对损失函数的影响。为解决此问题,我们提出了后量化积分 (PQI),一种以细粒度方式估计后验敏感度的准确度量。为利用这一准确度量,我们进一步提出了 ReQuant 框架,该框架主要由两个稠密-稀疏分离组件构成:自适应异常值选择和分步显著权重分离。结果表明,ReQuant 在 QTIP 上以显著的 2.66 情感提升显著优于当前后训练量化方法。

关键词

引用

@article{arxiv.2503.01901,
  title  = {Identifying Sensitive Weights via Post-quantization Integral},
  author = {Yuezhou Hu and Weiyu Huang and Zichen Liang and Chang Chen and Jintao Zhang and Jun Zhu and Jianfei Chen},
  journal= {arXiv preprint arXiv:2503.01901},
  year   = {2025}
}