中文

面向高效 LLM/VLM 的激活信息化全纤维 Pareto 指导低秩压缩

计算与语言 2025-10-08 v1 机器学习

摘要

大语言模型 (LLM) 和视觉语言模型 (VLM) 已实现最先进的性能,但在部署时带来显著的内存和计算挑战。我们提出一种新型低秩压缩框架以应对这一挑战。首先,我们通过层级激活基准的压缩误差上界,填补了文献中关于网络损失变化的理论空白。随后,我们将低秩模型压缩建模为双目标优化问题,并证明单一统一容忍度会导致非均匀的异构秩成为代理最优解。基于我们的理论洞见,我们提出 Pareto-Guided 奇异值分解 (PGSVD),这是一条零样本管道,通过 Pareto 指导的秩选择和交替最小二乘实现激活感知压缩。我们将 PGSVD 应用于 LLM 和 VLM,结果在相同压缩水平下实现更好的准确率和推理加速。

关键词

引用

@article{arxiv.2510.05544,
  title  = {Activation-Informed Pareto-Guided Low-Rank Compression for Efficient LLM/VLM},
  author = {Ryan Solgi and Parsa Madinei and Jiayi Tian and Rupak Swaminathan and Jing Liu and Nathan Susanj and Zheng Zhang},
  journal= {arXiv preprint arXiv:2510.05544},
  year   = {2025}
}