FoldGPT:简单有效的大语言模型压缩方案
机器学习
2024-07-02 v1 计算与语言
摘要
部署大型语言模型(LLMs)于移动设备的需求持续增长,这源于数据安全 concern 的增加以及云计算成本的攀升。然而,网络带宽和内存限制构成了在移动设备上部署数十亿级别模型的挑战。本研究调查了不同规模 LLMs 各层输出,发现大多数层的输出 exhibit significant similarity。且随模型规模增大,这种相似性更加突出,表明 LLMs 深度方向存在显著的冗余性。基于这一观察,我们提出一种高效的模型体积压缩策略,称为 FoldGPT,它结合了块状删除和块状参数共享。该策略包含三个部分:(1) 基于可学习的门控参数,我们确定块的重要性排序,同时建模块之间的耦合效应。然后根据给定的删除率删除一些冗余层。(2) 对于保留下来的块,我们应用特别设计的分组参数共享策略,位于同一组内的块共享相同的权重,从而大幅压缩参数数量,同时略微降低延迟开销。(3) 在共享这些块后,我们通过少量微调来“治疗”稀疏性导致的不匹配,并引入尾部层蒸馏策略以提升性能。实验表明,FoldGPT 在高效模型压缩方面优于以往的 SOTA 方法,表明通过简单的块删除和参数共享可实现模型轻量化的可行性。
引用
@article{arxiv.2407.00928,
title = {FoldGPT: Simple and Effective Large Language Model Compression Scheme},
author = {Songwei Liu and Chao Zeng and Lianqiang Li and Chenqian Yan and Lean Fu and Xing Mei and Fangmin Chen},
journal= {arXiv preprint arXiv:2407.00928},
year = {2024}
}