中文

DeltaDQ:基于组级 Dropout 和独立量化的超高 Delta 压缩用于微调 LLM

机器学习 2024-10-14 v1 人工智能

摘要

大型语言模型通过监督式微调在各种下游任务上实现卓越的性能。然而,下游任务的多样性和实际要求使得部署多个完整参数微调模型具有挑战性。当前那些压缩 delta 权重的方法在实现超高压缩方面效果不佳,无法最大限度地减少部署开销。为了解决上述问题,我们提出了一种新型的分布驱动 delta 压缩框架 DeltaDQ,该框架利用组级 Dropout 和独立量化来实现 delta 权重的超高压缩。我们观察到,delta 权重的矩阵计算中间结果在方差和 min-max 范围方面表现出极小且均衡的特征,称为平衡中间结果。利用这一现象,我们引入组级 Dropout 使用 optimal group size 对 delta 权重执行 Dropout。此外,通过独立量化,稀疏权重被量化并分解以实现更低的位数。实验结果表明,DeltaDQ 在 WizardMath 和 WizardCoder 模型的不同参数规模上相对于基线实现了 16 倍压缩,同时提高了准确率。此外,DeltaDQ 显示出实现超高压缩比的能力,WizardMath-7B 模型可实现 128 倍压缩,WizardMath-70B 模型可实现 512 倍压缩。

关键词

引用

@article{arxiv.2410.08666,
  title  = {DeltaDQ: Ultra-High Delta Compression for Fine-Tuned LLMs via Group-wise Dropout and Separate Quantization},
  author = {Yanfeng Jiang and Zelan Yang and Bohua Chen and Shen Li and Yong Li and Tao Li},
  journal= {arXiv preprint arXiv:2410.08666},
  year   = {2024}
}