不同提示,不同秩:基于SVD的LLM压缩中提示感知的动态秩选择
机器学习
2026-05-12 v1
摘要
大语言模型(LLM)的规模迅速增长,产生了巨大的内存和计算成本,阻碍了高效部署。奇异值分解(SVD)已成为一种有效的训练后压缩技术,但现有的基于SVD的方法依赖于静态秩截断,即对所有输入应用固定的奇异分量前缀,而不考虑其多样性。我们识别出这种静态设计的两个局限性:最优秩因不同提示而异,并且所选秩对校准集的选择敏感,导致在不同输入上的性能次优。为了解决这些挑战,我们提出了,一个用于SVD压缩LLM中rompt-ware ank election as xperts(提示感知的秩选择作为专家)的训练后框架。PARSE离线训练一个线性路由器以执行提示感知的秩选择,通过在大规模语料库上监督路由器与稠密模型输出的对齐,将其与校准信息解耦。我们进一步观察到,秩选择模式在语义相似的提示之间共享,并且在解码步骤中保持稳定,从而允许在推理时直接从模式缓存中提供适当的秩子集。结合用于系统级效率的专家内存聚合和内核融合,PARSE与现有的基于SVD的流水线正交,并持续改善模型质量和推理效率。与四种代表性的基于SVD的方法集成后,PARSE在LLaMA-7B上以0.6的压缩比将平均任务准确率提升了高达10%,并在预填充和解码阶段分别实现了高达2.5倍和2.4倍于原生SVD执行的加速。
引用
@article{arxiv.2605.08568,
title = {Different Prompts, Different Ranks: Prompt-aware Dynamic Rank Selection for SVD-based LLM Compression},
author = {Hengyi Zhu and Zhendong Mi and Grace Li Zhang and Shaoyi Huang},
journal= {arXiv preprint arXiv:2605.08568},
year = {2026}
}