Merge Hijacking:针对大型语言模型模型合并的后门攻击
密码学与安全
2025-05-30 v1
摘要
大型语言模型(LLMs)的模型合并直接融合了在不同任务上微调的各个模型的参数,从而创建一个用于多领域任务的统一模型。然而,由于开源平台上的可用模型可能存在漏洞,模型合并容易受到后门攻击。在本文中,我们提出了 Merge Hijacking,这是首个针对 LLMs 模型合并的后门攻击。攻击者构建一个恶意的上传模型并将其发布。一旦受害者用户将其与任何其他模型合并,生成的合并模型就会继承后门,同时保持跨任务的实用性。Merge Hijacking 定义了两个主要目标——有效性和实用性——并通过四个步骤实现这些目标。大量实验证明了我们的攻击在不同模型、合并算法和任务上的有效性。此外,我们表明,即使在合并现实世界模型时,该攻击仍然有效。而且,我们的攻击展示了对两种推理时防御(Paraphrasing 和 CLEANGEN)以及一种训练时防御(Fine-pruning)的鲁棒性。
引用
@article{arxiv.2505.23561,
title = {Merge Hijacking: Backdoor Attacks to Model Merging of Large Language Models},
author = {Zenghui Yuan and Yangming Xu and Jiawen Shi and Pan Zhou and Lichao Sun},
journal= {arXiv preprint arXiv:2505.23561},
year = {2025}
}
备注
This paper is accepted by ACL 2025 main conference