中文

安全模型融合为何变为危险:利用大语言模型融合中的潜在漏洞

密码学与安全 2026-04-02 v1

摘要

模型融合已成为一种强大的技术,可在无需额外训练成本的情况下,将多个微调后大语言模型的专门能力进行组合。然而,这一被广泛采用的实践的安全性影响仍严重地被低估。在本工作中,我们揭示模型融合引入了一种新型攻击面,可被系统性地利用来破坏安全对齐。我们提出了 TrojanMerge,一个将潜在恶意组件嵌入源模型的框架;这些源模型各自保持无害,但当它们被融合时,会产生严重不对齐的模型。我们的关键洞见是将此攻击表述为一个约束优化问题:我们构造扰动,通过方向一致性约束保持源模型的安全性,通过 Frobenius 方向对齐约束维持能力,但在融合过程中这些扰动组合形成预计算的攻击向量。在来自 3 个模型家族的 9 个大语言模型上进行的广泛实验表明,TrojanMerge 在融合模型中持续实现了高有害响应率,同时源模型保持了与未修改版本相当的安全评分。我们的攻击在多种融合算法下均成功,并在各种超参数配置下保持有效。这些发现揭示了当前模型融合实践中的根本性漏洞,并强调了迫切需要安全感知的机制。

关键词

引用

@article{arxiv.2604.00627,
  title  = {When Safe Models Merge into Danger: Exploiting Latent Vulnerabilities in LLM Fusion},
  author = {Jiaqing Li and Zhibo Zhang and Shide Zhou and Yuxi Li and Tianlong Yu and Kailong Wang},
  journal= {arXiv preprint arXiv:2604.00627},
  year   = {2026}
}