中文

噪声扰动微调:用于鲁棒 LLM 量化的控制敏感权重

机器学习 2025-03-18 v2 人工智能 计算与语言

摘要

量化是实现资源受限环境下高效 LLM 推理的关键步骤。然而,前期研究发现 LLM 中的某些权重(称为异常值)对量化噪声极其敏感。现有量化方法将这些异常值保留为浮点数或更高精度,以维持性能,但导致混合精度模型在硬件部署上存在挑战。本文通过通过高效微调过程降低异常值相对于损失 Hessian 迹的方式,来驾驭敏感权重对量化误差的影响。我们提出了噪声扰动微调(Noise Perturbation Fine-tuning, NPFT),通过在 PEFT 优化期间对异常值权重添加随机权重扰动来识别异常值。NPFT 驾驭了异常值权重的敏感性,从而在无需对异常值特殊处理的情况下提升量化模型性能。在 OPT 和 LLaMA 模型上,我们的方法对 uniform 和 non-uniform 量化器均实现稳定的性能提升,同时也提供更好的推理效率。值得注意的是,在 LLaMA2-7B-4bits 基准测试中,最简单的 RTN 量化方法即可通过我们的 NPFT 实现与 GPTQ 相当的性能。

关键词

引用

@article{arxiv.2412.06858,
  title  = {Taming Sensitive Weights : Noise Perturbation Fine-tuning for Robust LLM Quantization},
  author = {Dongwei Wang and Huanrui Yang},
  journal= {arXiv preprint arXiv:2412.06858},
  year   = {2025}
}

备注

Accepted as poster by CPAL2025