中文

从特洛伊木马到城堡围墙:揭示扩散模型中的双边数据投毒效应

机器学习 2024-06-18 v2

摘要

尽管最先进的扩散模型(DMs)在图像生成方面表现出色,但对其安全性的担忧持续存在。早期研究强调了 DMs 对数据投毒攻击的脆弱性,但这些研究比图像分类中诸如 `BadNets' 的传统方法提出了更严格的要求。这是因为此类技术需要对扩散训练和采样过程进行修改。与先前工作不同,我们研究类 BadNets 的数据投毒方法是否可以直接降低 DMs 的生成质量。换言之,如果仅污染训练数据集(不操纵扩散过程),这将如何影响所学 DMs 的性能?在此设定下,我们揭示了双边数据投毒效应,其不仅服务于对抗目的(损害 DMs 的功能),还提供防御优势(可用于分类任务中抵御投毒攻击的防御)。我们表明,类 BadNets 的数据投毒攻击在 DMs 中仍能有效地产生错误图像(与预期文本条件不对齐)。同时,被投毒的 DMs 在生成图像中表现出触发符比例增加的现象,我们称之为 `触发放大'。该洞见随后可用于增强对投毒训练数据的检测。此外,即使在低投毒比例下,研究 DMs 的投毒效应对设计鲁棒的图像分类器以抵御此类攻击也颇具价值。最后同样重要的是,我们通过探索 DMs 固有的数据记忆倾向,在数据投毒与数据复制现象之间建立了有意义的联系。

关键词

引用

@article{arxiv.2311.02373,
  title  = {From Trojan Horses to Castle Walls: Unveiling Bilateral Data Poisoning Effects in Diffusion Models},
  author = {Zhuoshi Pan and Yuguang Yao and Gaowen Liu and Bingquan Shen and H. Vicky Zhao and Ramana Rao Kompella and Sijia Liu},
  journal= {arXiv preprint arXiv:2311.02373},
  year   = {2024}
}

备注

9 pages, 5 figures, 4 tables