SeedLM:将大语言模型权重压缩至伪随机生成器的种子
机器学习
2024-10-17 v2 人工智能
摘要
大型语言模型(LLM)已彻底变革自然语言处理领域,但因其高昂的运行成本,在大规模部署方面面临重大挑战。本文引入 SeedLM,一种新型后训练压缩方法,利用伪随机生成器的种子对模型权重进行编码与压缩。具体而言,对于每个权重块,我们寻找一个种子,在推理过程中输入线性反馈移位寄存器(LFSR),以高效生成随机矩阵。该矩阵随后与压缩系数线性组合,以重构权重块。SeedLM 减少了内存访问,利用推理期间闲置的计算资源,有效加速以内存为瓶颈的任务,通过以计算换更少的内存访问。与依赖校准数据的数据驱动压缩方法不同,我们的方法无需数据,能在多样化任务上获得良好泛化。我们针对尤为难以压缩的 Llama 3 70B 模型进行实验,表明 SeedLM 在 4 位和 3 位精度下,相较于最新技术实现了显著更好的零样本准确率保持,同时性能可与 FP16 基准相当。此外,FPGA 实验显示,随着模型规模扩大至 70B,4 位 SeedLM 相较于 FP16 Llama 2/3 基准可实现约 4 倍的加速。
引用
@article{arxiv.2410.10714,
title = {SeedLM: Compressing LLM Weights into Seeds of Pseudo-Random Generators},
author = {Rasoul Shafipour and David Harrison and Maxwell Horton and Jeffrey Marker and Houman Bedayat and Sachin Mehta and Mohammad Rastegari and Mahyar Najibi and Saman Naderiparizi},
journal= {arXiv preprint arXiv:2410.10714},
year = {2024}
}