MagR:权重幅度缩减以增强后训练量化
机器学习
2024-10-18 v2 人工智能
摘要
本文提出一种简单的基于优化的预处理技术,称为权重幅度缩减(MagR),用于提升后训练量化的性能。对于每个线性层,我们通过求解一个正则化优化问题来调整预训练的浮点权重。这一过程极大地降低了权重的最大幅度并平滑了异常值,同时保持了层的输出。预处理后的权重更集中于零,从而有利于后续的量化过程。为了实现MagR,我们采用高效的近端梯度下降算法处理正则化。与现有的涉及线性变换和后续后处理步骤的预处理方法不同,这些方法会在推理时引入显著开销,而MagR作为一种非线性变换,无需任何额外的后处理。这确保了MagR在推理时完全不引入任何开销。我们的实验表明,MagR在Llama系列模型上达到了最先进的性能。例如,我们在LLaMA2-70B模型上实现了每通道INT2权重量化的Wikitext2困惑度为5.95,且不产生任何推理开销。
引用
@article{arxiv.2406.00800,
title = {MagR: Weight Magnitude Reduction for Enhancing Post-Training Quantization},
author = {Aozhong Zhang and Naigang Wang and Yanxia Deng and Xin Li and Zi Yang and Penghang Yin},
journal= {arXiv preprint arXiv:2406.00800},
year = {2024}
}
备注
Accepted by NeurIPS 2024