中文

不同提示,不同秩:基于SVD的LLM压缩中提示感知的动态秩选择

机器学习 2026-05-12 v1

摘要

大语言模型(LLM)的规模迅速增长,产生了巨大的内存和计算成本,阻碍了高效部署。奇异值分解(SVD)已成为一种有效的训练后压缩技术,但现有的基于SVD的方法依赖于静态秩截断,即对所有输入应用固定的奇异分量前缀,而不考虑其多样性。我们识别出这种静态设计的两个局限性:最优秩因不同提示而异,并且所选秩对校准集的选择敏感,导致在不同输入上的性能次优。为了解决这些挑战,我们提出了PARSE\textbf{PARSE},一个用于SVD压缩LLM中P\textbf{P}rompt-A\textbf{A}ware R\textbf{R}ank S\textbf{S}election as E\textbf{E}xperts(提示感知的秩选择作为专家)的训练后框架。PARSE离线训练一个线性路由器以执行提示感知的秩选择,通过在大规模语料库上监督路由器与稠密模型输出的对齐,将其与校准信息解耦。我们进一步观察到,秩选择模式在语义相似的提示之间共享,并且在解码步骤中保持稳定,从而允许在推理时直接从模式缓存中提供适当的秩子集。结合用于系统级效率的专家内存聚合和内核融合,PARSE与现有的基于SVD的流水线正交,并持续改善模型质量和推理效率。与四种代表性的基于SVD的方法集成后,PARSE在LLaMA-7B上以0.6的压缩比将平均任务准确率提升了高达10%,并在预填充和解码阶段分别实现了高达2.5倍和2.4倍于原生SVD执行的加速。

关键词

引用

@article{arxiv.2605.08568,
  title  = {Different Prompts, Different Ranks: Prompt-aware Dynamic Rank Selection for SVD-based LLM Compression},
  author = {Hengyi Zhu and Zhendong Mi and Grace Li Zhang and Shaoyi Huang},
  journal= {arXiv preprint arXiv:2605.08568},
  year   = {2026}
}