内在结构作为显著性代理:基于SVD的权重重保存在大语言模型混合精度量化中的应用
机器学习
2025-12-03 v2 人工智能
摘要
随着大语言模型(LLMs)的参数量持续增长,在通用硬件上部署它们变得越来越具有挑战性。训练后量化(PTQ)通过降低模型权重的精度(通常降至4位或更低)来解决这一问题。然而,均匀量化往往导致显著的性能下降,原因是存在"离群特征"——虽然数量很少但对维持模型准确性至关重要的权重。目前最先进的方法如AWQ(激活感知权重量化)和SpQR(稀疏量化表示)依赖校准数据通过激活幅度或Hessian敏感性来识别这些显著权重。在数据隐私至关重要或校准数据不可用的场景中,这些方法不适用。在本工作中,我们提出了一种无数据的、基于结构的假设:通过奇异值分解(SVD)识别为主成分的权重对模型的下游性能具有内在重要性。我们引入了一种新颖的选择启发式方法,在FP32中保留与前k个主成分对齐的顶部权重,同时积极量化残差权重。我们在GLUE基准测试(MRPC、RTE、QNLI)上使用DistilBERT骨干网络将我们的方法与激活感知方法(AWQ)和二阶方法(SpQR)进行了比较。实验表明,结构重要性与功能重要性高度相关。在具有挑战性的RTE任务上,我们的基于SVD的方法达到了66.06%的准确率,优于AWQ(65.34%)和SpQR(65.34%),在高保护预算下验证了内在矩阵结构可以作为权重重显著性的稳健代理,而无需前向传播或校准数据。
引用
@article{arxiv.2512.01343,
title = {Intrinsic Structure as a Proxy for Saliency: SVD-Based Weight Preservation for Mixed-Precision Quantization in Large Language Models},
author = {Shashank Landge and Abhishek Patil and Tejas kamble and Bhushan Buddhivant and Priyanka Joshi},
journal= {arXiv preprint arXiv:2512.01343},
year = {2025}
}