中文

一刀切不可取:面向更精确模型合并的分布感知稀疏化

计算与语言 2025-08-11 v1 人工智能 机器学习

摘要

模型合并已成为一种引人注目的用于多任务学习的免数据范式,能够将多个微调模型融合为一个强大的单一实体。合并方法中的一项关键技术是稀疏化,它从任务向量中剪枝冗余参数以缓解干扰。然而,主流方法采用“一刀切”策略,应用统一的稀疏率,忽视了模型参数固有的结构和统计异质性。这通常导致次优的权衡,即关键参数被无意剪枝,而较少有用的参数却被保留。为解决这一局限性,我们引入了 \textbf{TADrop}(\textbf{T}ensor-wise \textbf{A}daptive \textbf{Drop}),一种尊重这种异质性的自适应稀疏化策略。TADrop 不使用全局比率,而是根据每个参数张量的分布特性为其分配定制的稀疏级别。其核心直觉是,具有更密集、更冗余分布的张量可以被激进地剪枝,而更稀疏、更关键的张量则被保留。作为一个简单且即插即用的模块,我们通过将 TADrop 与基础、经典和 SOTA 合并方法相集成来验证其有效性。在多种任务(视觉、语言和多模态)和模型(ViT、BEiT)上的广泛实验表明,TADrop 持续且显著地提升了它们的性能。例如,在增强一种领先的合并方法时,它在 8 项 ViT-B/32 任务上实现了平均 2.0\% 的性能提升。TADrop 通过根据模型结构定制稀疏化,提供了一种更有效的缓解参数干扰的方法,为高性能模型合并提供了新的基线。

关键词

引用

@article{arxiv.2508.06163,
  title  = {One Size Does Not Fit All: A Distribution-Aware Sparsification for More Precise Model Merging},
  author = {Yingfeng Luo and Dingyang Lin and Junxin Wang and Ziqiang Xu and Kaiyan Chang and Tong Zheng and Bei Li and Anxiang Ma and Tong Xiao and Zhengtao Yu and Jingbo Zhu},
  journal= {arXiv preprint arXiv:2508.06163},
  year   = {2025}
}

备注

Under review