中文

免费午餐:通过模型合并净化后门模型

计算与语言 2024-06-04 v2

摘要

通过开源计划实现预训练语言模型的民主化,迅速推动了创新并扩大了对尖端技术的访问。然而,这种开放性也带来了显著的安全风险,包括后门攻击,其中隐藏的恶意行为由特定输入触发,损害了自然语言处理(NLP)系统的完整性和可靠性。本文提出,将后门模型与其他同质模型合并,即使这些模型并非完全安全,也能显著修复后门漏洞。在我们的实验中,我们在各种模型(BERT-Base、RoBERTa-Large、Llama2-7B和Mistral-7B)和数据集(SST-2、OLID、AG News和QNLI)上验证了我们的假设。与多种先进的防御方法相比,我们的方法在分类和指令微调任务上提供了一种有效且高效的推理阶段后门攻击防御,无需额外资源或特定知识。我们的方法持续优于近期先进的基线方法,平均攻击成功率降低约75%。由于模型合并已是提升模型性能的成熟方法,其在防御方面提供的额外优势可视为一种零成本的额外收益。

关键词

引用

@article{arxiv.2402.19334,
  title  = {Here's a Free Lunch: Sanitizing Backdoored Models with Model Merge},
  author = {Ansh Arora and Xuanli He and Maximilian Mozes and Srinibas Swain and Mark Dras and Qiongkai Xu},
  journal= {arXiv preprint arXiv:2402.19334},
  year   = {2024}
}

备注

accepted to ACL2024 (Findings)