中文

IO-SVD:面向自适应秩大语言模型压缩的输入-输出白化奇异值分解

机器学习 2026-05-18 v1

摘要

大语言模型在语言和推理任务上表现出色,但其存储和计算成本仍然是其在资源受限和延迟敏感环境中部署的主要障碍。基于奇异值分解(SVD)的训练后压缩提供了一种与硬件无关的方法,通过低秩分解来减小模型尺寸并提高推理效率。然而,现有方法通常依赖于仅输入白化空间、同质秩分配或与损失无关的分配启发式方法,限制了它们在激进压缩下保持模型质量的能力。我们提出了输入-输出白化奇异值分解(IO-SVD),这是一种为模型权重构建 KL 感知的双侧白化空间的训练后压缩方法。利用对 top-K 标记概率的 KL 损失的二阶展开,IO-SVD 构建了一个捕捉预测敏感度的输出侧度量,而输入白化则捕捉激活统计信息。我们进一步引入了一种高效的异质秩分配策略,该策略使用一阶校准损失估计对白化后的奇异分量进行评分,并在全局预算下剪枝最不敏感的分量。受先前将 SVD 截断与量化相结合的工作启发,我们通过损失感知重映射改进了混合 SVD-量化压缩,该重映射根据量化低秩因子行所引起的预测损失变化来选择进行 8 位量化的行。跨多种 LLM 和 VLM 家族的大量实验以及推理时间分析表明,IO-SVD 在压缩 LLM 时性能下降极小,同时提供了实用的推理加速。代码可在 https://github.com/mint-vu/IO-SVD.git 获取。

关键词

引用

@article{arxiv.2605.15626,
  title  = {IO-SVD: Input-Output Whitened SVD for Adaptive-Rank LLM Compression},
  author = {Ali Abbasi and Chayne Thrash and Haoran Qin and Hamed Pirsiavash and Soheil Kolouri},
  journal= {arXiv preprint arXiv:2605.15626},
  year   = {2026}
}