中文

通过零样本图像净化实现黑盒后门防御

计算机视觉与模式识别 2023-10-31 v2 人工智能 密码学与安全

摘要

后门攻击向训练数据中注入中毒样本,导致模型部署期间对中毒输入的错误分类。防御此类攻击具有挑战性,尤其是对于仅允许查询访问的真实世界黑盒模型。本文中,我们提出一种通过对零样本图像净化(ZIP)来防御后门攻击的新框架。我们的框架可应用于中毒模型,无需模型的内部信息或任何关于干净/中毒样本的先验知识。我们的防御框架包含两步。首先,我们对中毒图像施加线性变换(例如模糊)以破坏后门模式。然后,我们使用预训练扩散模型来恢复被该变换移除的缺失语义信息。特别地,我们设计了一种新的反向过程,利用变换后的图像引导高保真净化图像的生成,该过程在零样本设定下工作。我们在多个数据集上以不同类型攻击评估了 ZIP 框架。实验结果证明了我们的 ZIP 框架相对于最先进后门防御基线的优越性。我们相信我们的结果将为未来黑盒模型的防御方法提供有价值的见解。我们的代码可在 https://github.com/sycny/ZIP 获取。

关键词

引用

@article{arxiv.2303.12175,
  title  = {Black-box Backdoor Defense via Zero-shot Image Purification},
  author = {Yucheng Shi and Mengnan Du and Xuansheng Wu and Zihan Guan and Jin Sun and Ninghao Liu},
  journal= {arXiv preprint arXiv:2303.12175},
  year   = {2023}
}

备注

Accepted by NeurIPS 2023