中文

LLM 的层次稀疏+低秩压缩

机器学习 2026-01-14 v1 人工智能

摘要

现代大型语言模型(LLM)对内存和计算预算提出了巨大的挑战,使得原则性压缩对部署和持续训练至关重要。我们提出层次稀疏+低秩(HSS)压缩,是一个两阶段方案:(i)将最大幅度权重删除到稀疏矩阵 S 中,(ii)对稠密残差矩阵应用递归层次稀疏可分(HSS)低秩分解。引入递归秩约简策略和逆 Cuthill-Mckee(RCM)置换,将高权重对齐至对角线,与块对角层次结构相结合,最大化非对角线压缩性(因为它们只被访问一次)。HSS 对硬件友好:其矩阵向量乘法可简化为一个稀疏运算和一系列薄矩阵乘法,并且可使用标准优化器进行端到端训练。在 LLaMA-7B 上的实验表明,仅针对自注意力投影层(在总计 7B 参数中取 1.6 B 参数的 Q、K、V 矩阵)即可获得显著的内存节省,同时保持与最新状态的困惑分数相当。例如,在 30% 稀疏预算和外层秩 512 的情况下,sHSS-RCM 达到困惑为 1.64,超越稠密基线和经典稀疏+奇异值分解变体,同时实现了显著的内存节省。

关键词

引用

@article{arxiv.2601.07839,
  title  = {Hierarchical Sparse Plus Low Rank Compression of LLM},
  author = {Pawan Kumar and Aditi Gupta},
  journal= {arXiv preprint arXiv:2601.07839},
  year   = {2026}
}

备注

9 pages, 3 figures, Accepted in ACM International Conference on Data Science, CODS-2026