FLRQ:利用灵活低秩矩阵草图实现更快的LLM量化
机器学习
2026-01-12 v1
摘要
传统的训练后量化(PTQ)被认为是减小模型大小和加速大规模语言模型(LLMs)推理的有效方法。然而,现有的低秩PTQ方法需要昂贵的微调来确定一个适用于大型模型中多样化数据和层的折衷秩,未能充分发挥其潜力。此外,当前基于SVD的低秩近似加剧了计算开销。在这项工作中,我们深入分析了低秩近似在代表性模型的不同层中的不同有效性。据此,我们引入了灵活低秩量化(FLRQ),这是一种新颖的解决方案,旨在快速识别精度最优的秩并聚合它们以实现最小的存储组合。FLRQ包含两个强大的组件:基于Rank1-Sketch的灵活秩选择(R1-FLR)和裁剪下的最佳低秩近似(BLC)。R1-FLR应用带有高斯投影的R1-Sketch进行快速低秩近似,从而能够为每一层提取异常值感知的秩。同时,BLC旨在通过迭代方法最小化缩放和裁剪策略下的低秩量化误差。FLRQ在综合实验中展示了强大的有效性和鲁棒性,在量化质量和算法效率方面均达到了最先进的性能。
引用
@article{arxiv.2601.05684,
title = {FLRQ: Faster LLM Quantization with Flexible Low-Rank Matrix Sketching},
author = {Hongyaoxing Gul and Lijuan Hu and Shuzi Niu and Fangfang Liu},
journal= {arXiv preprint arXiv:2601.05684},
year = {2026}
}