ComPEFT:通过稀疏化与量化压缩参数高效更新的通信
机器学习
2025-08-12 v2 人工智能
计算与语言
摘要
参数高效微调(PEFT)技术使得能够高效地将语言模型适配为专用于新任务或领域的“专家”模型。近期在模型合并与组合泛化方面的技术通过动态组合模块来利用这些专家模型,从而改善零样本/少样本泛化。尽管 PEFT 方法具有高效性,专家模型的规模可能使得在高延迟网络(如互联网)上按查询检索专家模型或在单个 GPU 上服务多个专家变得繁重。为解决这些问题,我们提出 ComPEFT,一种用于压缩基于 PEFT 的模型的微调残差(任务向量)的新方法。ComPEFT 采用稀疏化与三值量化来减小 PEFT 模块的尺寸,而无需进行任何额外重训练,同时保持或提升模型性能。在涵盖 200M 至 65B 参数的 T5、T0 和基于 LLaMA 的模型的广泛评估中,ComPEFT 实现了 8 倍至 50 倍的压缩比。特别地,我们表明 ComPEFT 随规模提升而改善——更强的模型表现出更高的可压缩性与更好的性能。例如,我们表明应用于 LLaMA 的 ComPEFT 在 MMLU 上以最高 26 倍的存储大小缩减优于 QLoRA 达 4.16%。此外,我们表明 ComPEFT 生成的压缩专家保持了少样本组合泛化能力,促进了高效的通信与计算,并在合并时表现出增强的性能。最后,我们对不同方法组件进行了分析,将其与其他 PEFT 方法比较,并测试了 ComPEFT 压缩全微调残差的有效性。我们的代码可在 https://github.com/prateeky2806/compeft 获取。
引用
@article{arxiv.2311.13171,
title = {ComPEFT: Compression for Communicating Parameter Efficient Updates via Sparsification and Quantization},
author = {Prateek Yadav and Leshem Choshen and Colin Raffel and Mohit Bansal},
journal= {arXiv preprint arXiv:2311.13171},
year = {2025}
}
备注
25 Pages, 6 Figures, 16 Tables