中文

面向增量压缩的动态基模型偏移

计算机视觉与模式识别 2025-05-19 v1 机器学习

摘要

基于 Transformer 的预训练-微调范式带来了显著进步,但也伴随着在多任务上微调模型的沉重存储和部署成本。增量压缩试图通过剪枝或量化来降低增量参数(即微调模型与预训练模型权重之间的差异)的冗余,从而降低成本。然而,现有方法默认使用预训练模型作为基模型,并为每个任务压缩增量参数,这可能导致显著的性能下降,尤其是在压缩率极高时。为了解决这个问题,我们研究了不同基模型对增量压缩性能的影响,发现预训练基模型很难是最优的。为此,我们提出了动态基模型偏移(DBMS),它在执行增量压缩之前动态地将基模型适配到目标任务。具体来说,我们调整两个参数,它们分别决定基模型偏移的幅度和增量压缩的整体规模,以提升每个任务上的压缩性能。通过对这两个参数进行低成本学习,我们的 DBMS 即使在极高压缩比设置下也能保持微调模型的大部分性能,显著超越了现有方法。此外,我们的 DBMS 是正交的,可以与多种其他方法集成,并且已在包括语言、视觉 Transformer 和多模态模型在内的不同类型模型上进行了评估。

关键词

引用

@article{arxiv.2505.11344,
  title  = {Dynamic Base model Shift for Delta Compression},
  author = {Chenyu Huang and Peng Ye and Shenghe Zheng and Xiaohui Wang and Lei Bai and Tao Chen and Wanli Ouyang},
  journal= {arXiv preprint arXiv:2505.11344},
  year   = {2025}
}

备注

16 pages, 7 figures