DeltaLLM:通过共享权重之间的低秩差压缩 LLM
机器学习
2025-02-25 v2 人工智能
摘要
我们提出 DeltaLLM,这是一种新的后训练压缩技术,用于缩减 LLM 的内存占用。我们提出了一种以 Transformer 块中后续层之间权重共享为基础的 LLM 结构方式,同时添加额外的低秩差异矩阵。对于训练,我们采用逐步模块替换方法,表明使用约 3000 万至 4000 万 token 的轻量级训练足以实现与从头训练相同规模 LLM 相当的性能。我们发布了结果模型 DeltaLLAMA 和 DeltaPHI,参数减少 12%,在常见知识和推理基准测试中保留了基本 Llama 和 Phi 模型的 90% 性能。我们的方法也优于参数相同数量删除的压缩技术 JointDrop、LaCo、ShortGPT 和 SliceGPT。例如,DeltaPhi 29 亿参数通过 24% 的参数减少,即可实现与经 fine-tuning 的 SlicedPhi 33 亿参数通过 12% 参数减少相当的平均零样本准确率,尽管其参数约 4000 万少且未进行 fine-tuning。本工作为在存储空间有限时 LLM 架构设计和压缩方法提供了新见解。
引用
@article{arxiv.2501.18596,
title = {DeltaLLM: Compress LLMs with Low-Rank Deltas between Shared Weights},
author = {Liana Mikaelyan and Ayyoob Imani and Mathew Salvaris and Parth Pathak and Mohsen Fayyaz},
journal= {arXiv preprint arXiv:2501.18596},
year = {2025}
}