中文

Mudjacking:修补基础模型中的后门漏洞

密码学与安全 2024-02-26 v1 计算机视觉与模式识别 机器学习

摘要

基础模型已成为 AI 生态系统的骨干。特别是,基础模型可用作通用特征提取器以构建各种下游分类器。然而,基础模型易受后门攻击,且被植入后门的基础模型是 AI 生态系统的单点故障,例如多个下游分类器会同时继承后门漏洞。在本工作中,我们提出了 Mudjacking,这是第一种修补基础模型以移除后门的方法。具体而言,给定在部署被植入后门的基础模型后检测到的嵌入触发器的误分类输入,Mudjacking 会调整基础模型的参数以移除后门。我们将修补基础模型表述为一个优化问题,并提出了一种基于梯度下降的方法来求解该问题。我们在视觉和语言基础模型、十一个基准数据集、五种现有后门攻击以及十三种自适应后门攻击上评估了 Mudjacking。结果表明,Mudjacking 能够在保持基础模型效用的同时移除后门。

关键词

引用

@article{arxiv.2402.14977,
  title  = {Mudjacking: Patching Backdoor Vulnerabilities in Foundation Models},
  author = {Hongbin Liu and Michael K. Reiter and Neil Zhenqiang Gong},
  journal= {arXiv preprint arXiv:2402.14977},
  year   = {2024}
}

备注

To appear in USENIX Security Symposium, 2024