LORD:面向一次性压缩的单语代码 LLM 低秩分解
计算与语言
2023-09-26 v1 人工智能
摘要
矩阵的低秩分解——将一个大矩阵拆分为两个较小矩阵的乘积——提供了一种压缩手段,可在不稀疏化的前提下减少模型参数量,从而在现代硬件上获得更高加速。此外,与量化不同,压缩后的线性层仍完全可微且所有参数可训练,同时能够利用现有针对浮点矩阵的高效核。我们研究了通过低秩分解(LoRD)压缩用于单语代码生成的大语言模型(LLMs)的潜力,并观察到这些模型中线性层的秩最多可降低 39.58%,而困惑度增加小于 1%。随后我们使用低秩分解(LoRD)将 StarCoder 16B 压缩至 13.2B 参数且无性能下降,压缩至 12.3B 时 HumanEval Pass@1 分数仅有极小下降,在单块 A100 上耗时不到 10 分钟。压缩模型在 huggingface 基于 pytorch 后端的实现上仅改动一行代码,便使推理速度提升高达 22.35%。低秩分解(LoRD)模型仍与 SpQR 等最先进的近无损量化方法兼容,从而可利用量化带来的进一步压缩收益。最后,在低秩分解(LoRD)模型上的 QLoRA 相比原始 QLoRA 额外减少多达 21.2% 的内存需求,同时提供类似的参数高效微调收益。我们的工作表明低秩分解(LoRD)是一种有前景的 LLM 压缩新范式。
引用
@article{arxiv.2309.14021,
title = {LORD: Low Rank Decomposition Of Monolingual Code LLMs For One-Shot Compression},
author = {Ayush Kaushal and Tejas Vaidhya and Irina Rish},
journal= {arXiv preprint arXiv:2309.14021},
year = {2023}
}
备注
9 pages