DARE the Extreme:重新审视精调模型的 Delta 参数剪枝
机器学习
2025-04-22 v2 人工智能
计算与语言
摘要
将开源精调模型单独存储会引入冗余并增加利用多个模型的应用响应时间。Delta 参数剪枝(DPP),特别是 Yu 等人提出的随机丢弃和重缩放(DARE)方法,通过剪枝大部分 delta 参数——即精调模型权重与预训练模型权重之间的差异——来解决这一问题,通常可维持最小的性能损失。然而,在修剪率或 delta 参数的幅度较大时,DARE 会失败。我们指出了两种导致此失败的关键原因:(1)随着修剪率的增加,过大的重缩放因子;(2)delta 参数的高均值和方差。为推进 DARE 的极限,我们引入 DAREx(DARE the eXtreme),其包含两种算法改进:(1)DAREx-q,这种重缩放因子修改在高修剪率下显著提升性能(例如对于编码器模型在 COLA 和 SST2 上超过 30%,decoder 模型的收益更为显著),(2)DAREx-L2,这种方法将 DARE 与 AdamR 结合,即一种在 DPP 之前应用适当 delta 正则化的训练中方法。我们也展示了 DAREx-q 可以无缝地与像 LoRA 这样的纯参数高效微调技术相结合,并可促进结构 DPP。此外,我们重新审视了在 DPP 中应用基于重要性的剪枝技术的可能性,证明它们在 delta 参数较大时优于基于随机的剪枝方法。通过这项全面的研究,我们开发了一种在各种实际情景下选择最合适 DPP 方法的 pipeline。
关键词
引用
@article{arxiv.2410.09344,
title = {DARE the Extreme: Revisiting Delta-Parameter Pruning For Fine-Tuned Models},
author = {Wenlong Deng and Yize Zhao and Vala Vakilian and Minghui Chen and Xiaoxiao Li and Christos Thrampoulidis},
journal= {arXiv preprint arXiv:2410.09344},
year = {2025}
}