稀疏感知低秩表示:高效大语言模型微调方法
机器学习
2026-01-29 v2 人工智能
摘要
适配大型预训练语言模型以应对下游任务通常需要对数百万参数进行微调,或部署高昂的稠密权重更新,这阻碍了其在资源受限环境中的应用。低秩适应(LoRA)通过分解权重更新来减少可训练参数,但底层稠密权重仍造成高存储和计算成本。基于幅值的修剪可产生稀疏模型,但通常会在直接应用于 LoRA 时导致其性能下降。本文引入 SALR(稀疏感知低秩表示),一种新颖的微调范式,将低秩适应与稀疏修剪在严格的均方误差框架下统一。我们证明,仅对冻结的基准权重进行静态修剪可最小化修剪误差界,并通过截断 SVD 低秩适配器恢复被丢弃的残差信息,此技术在每个条目处的均方误差可降低 倍。为最大化硬件效率,我们将多个低秩适配器融合为单个拼接 GEMM,并采用基于位图的编码,采用两阶段流水线解码 + GEMM 设计以实现真正的模型压缩和加速。经验上,SALR 在各种大语言模型上实现 50% 稀疏度,同时在 GSM8K 和 MMLU 上匹配 LoRA 的性能,模型规模缩减 ,推理加速最高达 。
引用
@article{arxiv.2601.16991,
title = {Sparsity-Aware Low-Rank Representation for Efficient Fine-Tuning of Large Language Models},
author = {Longteng Zhang and Sen Wu and Shuai Hou and Zhengyu Qing and Zhuo Zheng and Danning Ke and Qihong Lin and Qiang Wang and Shaohuai Shi and Xiaowen Chu},
journal= {arXiv preprint arXiv:2601.16991},
year = {2026}
}