中文

模型不可合并:使模型不可合并以实现安全的模型共享

机器学习 2025-09-03 v1

摘要

模型合并利用多个微调后的专家模型以低成本构建多任务模型,正受到越来越多的关注。然而,随着越来越多微调模型公开可用,模型合并的安全性问题引发了担忧。未经授权的合并可能侵犯开发者的权利,并存在泄露敏感个人信息的风险。大多数现有方法侧重于检测合并模型是否源自特定源模型,但未能有效阻止非法合并。在本文中,我们提出了MergeLock,一种主动保护机制,通过扰动模型参数使其不可合并,从而直接防止未经授权的模型合并。具体而言,利用基于Transformer的模型中注意力机制的固有对称性,我们随机采样两对可逆矩阵并将其应用于查询-键(QK)和值-输出(VO)分支。该变换在保持模型输出不变的同时,将其推离其他微调模型的共享参数空间。大量视觉和语言任务的实验表明,当受保护模型参与时,MergeLock可使合并模型的性能下降超过95%,证明了其有效性。此外,我们进一步证明,受MergeLock保护的合并模型无法通过低成本恢复方法有效恢复,进一步增强了对未经授权合并的鲁棒性。代码地址:https://github.com/hetailang/Merge-Lock。

关键词

引用

@article{arxiv.2509.01548,
  title  = {Model Unmerging: Making Your Models Unmergeable for Secure Model Sharing},
  author = {Zihao Wang and Enneng Yang and Lu Yin and Shiwei Liu and Li Shen},
  journal= {arXiv preprint arXiv:2509.01548},
  year   = {2025}
}