基于安全感知子空间的多任务模型合并防御后门
密码学与安全
2025-02-28 v2 机器学习
摘要
模型合并已获得广泛关注,作为将多个单任务微调模型集成到一个能够在多个任务上表现良好的统一模型的成本效益方法。然而,现有模型合并技术主要关注解决任务特定模型之间的冲突,往往忽视安全威胁,尤其是开源模型生态系统中后门攻击的风险。本文首先研究了现有模型合并方法对后门攻击的脆弱性,识别出两个关键挑战:后门继延和后门迁移。为解决这些问题,我们提出了一种 novel Defense-Aware Merging (DAM) 方法,同时缓解任务干扰和后门漏洞。具体而言,DAM 采用基于元学习的优化方法 with dual masks 来识别模型合并的共享和安全感知子空间。这些掩码交替优化:Task-Shared 掩码识别跨任务的有益公共参数,旨在保留任务特定知识同时减少干扰;Backdoor-Detection 掩码隔离潜在有害参数,以中和安全威胁。这种双掩码设计允许我们在保护有用知识和消除潜在漏洞之间进行 careful 平衡。与现有合并方法相比,DAM 在性能和安全性之间取得更好的平衡,通过将攻击成功率降低 2-10 个百分点,同时仅牺牲约 1% 的准确率。此外,DAM 在各种类型后门攻击和参与合并的受损模型数量上表现出稳健的性能和广泛的适用性。我们的代码和模型已公开 https://github.com/Yangjinluan/DAM。
引用
@article{arxiv.2410.13910,
title = {Mitigating the Backdoor Effect for Multi-Task Model Merging via Safety-Aware Subspace},
author = {Jinluan Yang and Anke Tang and Didi Zhu and Zhengyu Chen and Li Shen and Fei Wu},
journal= {arXiv preprint arXiv:2410.13910},
year = {2025}
}
备注
arxiv version of ICLR2025