SkipCat:通过共享投影与块跳过实现大语言模型的排序最大化低秩压缩
计算与语言
2025-12-16 v1 人工智能
摘要
大语言模型(LLM)在广泛的任务中取得了显著的性能,但其庞大的参数规模对部署在计算和内存资源有限的边缘设备提出了重大挑战。低秩压缩是一种有前景的解决方法,可降低计算和内存成本,使 LLM 更适用于资源受限的环境。然而,naive 低秩压缩方法需要显著降低保留秩才能实现实质性的内存和计算节省。对于低秩模型,要实现效率提升,需将秩降低超过一半。这种激进的截断通常会导致显著的性能下降。为解决这一权衡,我们提出了 SkipCat,一种 novel 低秩压缩框架,使可使用更高的秩而实现相同的压缩率。首先,我们引入一种 intra-layer shared low-rank projection 方法,其中多个共享相同输入的矩阵使用 common projection。这减少了冗余并提高了压缩效率。其次,我们提出了一种 block skipping 技术,可省略低秩分解中 selected 子块的计算和内存传输。这两种技术共同使压缩模型在相同压缩预算下保留更多有效秩。实验结果表明,在不进行额外微调的情况下,我们的方法在相同压缩率下比以前的低秩压缩方法在 zero-shot 任务上实现 7% 的 accuracy 提升。这些结果凸显了在资源受限环境下保持模型性能的 rank-maximized 压缩策略的有效性。
引用
@article{arxiv.2512.13494,
title = {SkipCat: Rank-Maximized Low-Rank Compression of Large Language Models via Shared Projection and Block Skipping},
author = {Yu-Chen Lu and Sheng-Feng Yu and Hui-Hsien Weng and Pei-Shuo Wang and Yu-Fang Hu and Liang Hung-Chun and Hung-Yueh Chiang and Kai-Chiang Wu},
journal= {arXiv preprint arXiv:2512.13494},
year = {2025}
}
备注
Accepted by AAAI 2026