DAQ:面向大语言模型的密度感知后训练权重唯一量化
机器学习
2024-10-18 v2 人工智能
摘要
大型语言模型(LLMs)在各种任务中表现出色,但因硬件限制而面临部署挑战。我们提出了密度感知后训练权重唯一量化(DAQ),该方法包含两个阶段:1)密度中心对齐,识别高密度权重的中心,并将动态范围对准该点,以将高密度权重区域对齐到浮点高精度区域;2)可学习的动态范围调整,通过优化量化参数(即尺度和零点)来调整动态范围,基于权重对模型输出的影响。在LLaMA和LLaMA-2上的实验表明,DAQ始终优于最佳基线方法,在LLaMA上平均减少22.8%的困惑度损失,在LLaMA-2上平均减少19.6%。我们的代码已公开于https://github.com/LuoYingSong/DAQ。
引用
@article{arxiv.2410.12187,
title = {DAQ: Density-Aware Post-Training Weight-Only Quantization For LLMs},
author = {Yingsong Luo and Ling Chen},
journal= {arXiv preprint arXiv:2410.12187},
year = {2024}
}
备注
9 pages, 4 figures