中文

ROSAQ:基于旋转的感知感通道权重量化以高效压缩大型语言模型

计算与语言 2025-06-18 v2 人工智能

摘要

量化广泛作为一种有效技术,用于减少大型语言模型(LLM)的内存要求,potentially还能提高延迟时间。利用变换器的旋转不变性特征,我们提出了基于旋转的感知感通道权重量化(ROSAQ),该方法识别投影特征空间中的感知通道,而非原始特征空间中的通道,其中投影后的"主"维度自然被视为"感知"特征。ROSAQ包括1)基于PCA的投影,对校准集进行主成分分析(PCA),并通过PCA投影进行转换,2)感知通道识别,选择对应最大K个特征值维度的通道作为感知通道,3)感知感通道量化,采用混合精度,对感知维度使用FP16,对其他维度使用INT3/4。实验结果表明,ROSAQ在原始特征空间上的感知感通道量化基准以及其他现有量化方法上均取得改进。通过内核融合,ROSAQ在批量大小为64时,生成256个标记的FP16实现速度提升约2.3倍。

关键词

引用

@article{arxiv.2506.13472,
  title  = {ROSAQ: Rotation-based Saliency-Aware Weight Quantization for Efficiently Compressing Large Language Models},
  author = {Junho Yoon and Geom Lee and Donghyeon Jeon and Inho Kang and Seung-Hoon Na},
  journal= {arXiv preprint arXiv:2506.13472},
  year   = {2025}
}

备注

10 pages, 2 figures