Watch the Watcher! 对增强安全性扩散模型的后门攻击
密码学与安全
2024-06-17 v1
摘要
尽管因其卓越的去噪能力,扩散模型正日益被用于作为防御性工具来强化其他模型的安全性,尤其在净化对抗性样本和 certifying 对抗鲁棒性方面,但这些实践本身的安全风险仍 largely 未被探讨,这颇为令人担忧。为填补这一差距,本文研究了增强安全性扩散模型的脆弱性。具体而言,我们展示了这些模型对 DIFF2——一种简单而有效的后门攻击——高度敏感,这显著削弱了此类模型提供的安全保障。本质上,DIFF2 通过将恶意扩散采样过程集成到扩散模型中,引导携带特定触发器的输入导向 adversary 定义的分布,同时保持干净输入的正常功能。我们的案例研究涉及对抗净化和鲁棒性认证,显示 DIFF2 能显著降低基准数据集和模型上的后净化准确率和认证准确率,凸显了依赖预训练扩散模型作为防御工具的潜在风险。我们进一步探讨了可能的对策,为未来研究指出了有前景的方向。
引用
@article{arxiv.2406.09669,
title = {Watch the Watcher! Backdoor Attacks on Security-Enhancing Diffusion Models},
author = {Changjiang Li and Ren Pang and Bochuan Cao and Jinghui Chen and Fenglong Ma and Shouling Ji and Ting Wang},
journal= {arXiv preprint arXiv:2406.09669},
year = {2024}
}