用于防御后门攻击的显著条件扩散
机器学习
2023-05-22 v2 密码学与安全
计算机视觉与模式识别
摘要
我们提出了一种新算法——显著条件扩散(Sancdifi),一种最先进的(SOTA)后门攻击防御方法。Sancdifi 使用去噪扩散概率模型(DDPM)以噪声降解图像,然后通过学习到的反向扩散恢复该图像。关键的是,我们计算基于显著图的掩码以条件化我们的扩散,使 DDPM 能对最显著的像素进行更强扩散。因此,Sancdifi 能高效扩散掉后门攻击所投毒数据中的触发器。同时,应用于干净数据时,它能可靠恢复显著特征。该性能在无需访问木马网络模型参数的情况下即可实现,意味着 Sancdifi 作为一种黑盒防御运行。
引用
@article{arxiv.2301.13862,
title = {Salient Conditional Diffusion for Defending Against Backdoor Attacks},
author = {Brandon B. May and N. Joseph Tatro and Dylan Walker and Piyush Kumar and Nathan Shnidman},
journal= {arXiv preprint arXiv:2301.13862},
year = {2023}
}
备注
14 pages, 5 figures. Edit: Added new baselines