中文

无牺牲准确性的参数级防御:颠覆模型合并

机器学习 2025-07-01 v2 人工智能 密码学与安全

摘要

模型合并是一种将多个微调模型合并为单个模型的技术,无需额外训练,使自由骑手能够廉价继承专门能力。本研究探索了抑制自由骑手进行模型合并的 methodologies。现有方法如模型水印或指纹化只能事后检测合并情况。相比之下,我们提出了一种针对模型合并的首个主动防御方法。具体而言,本防御方法修改模型参数,以确保模型在与任何其他模型合并时被破坏,而在未与其他模型合并时保持其功能不变。我们的方法包含两个模块:重新排列 MLP 参数和缩放注意力头,这些操作将模型推出参数空间中的共享 basin,导致与其他模型的合并性能显著下降。我们在图像分类、图像生成和文本分类上进行了广泛实验,证明该防御在保留后保护模型功能的同时严重破坏了合并。此外,我们分析了潜在的自适应攻击,并进一步提出一种基于 dropout 的剪枝以提高本方案的鲁棒性。

关键词

引用

@article{arxiv.2503.07661,
  title  = {Disrupting Model Merging: A Parameter-Level Defense Without Sacrificing Accuracy},
  author = {Wei Junhao and Yu Zhe and Sakuma Jun},
  journal= {arXiv preprint arXiv:2503.07661},
  year   = {2025}
}

备注

Accepted by ICCV 2025