面向不可辨认扩散模型的可迁移对抗攻击探针
计算机视觉与模式识别
2024-05-01 v1
摘要
高级文本到图像扩散模型引发了关于身份隐私泄露、版权侵权以及生成不适合作品 (Not Safe For Work) 内容的安全顾虑。为此,已开发出用于擦除扩散模型中这些概念的不可辨认方法。然而,这些不可辨认方法仅改变文本到图像的映射,保留扩散模型生成空间内的视觉内容,留下致命缺陷——难以恢复被擦除的概念。这种不可辨认性问题亟需被探针,但现有方法从两个方面都不够理想:(1) 缺乏可迁移性:部分方法 operate 在白盒环境中,需要访问不可辨认模型;而所学的对抗输入常常无法迁移到其他不可辨认模型以实现概念恢复;(2) 攻击受限:prompt 级别的方法难以从不可辨认模型中恢复狭窄概念,如明星身份。因此,本文旨在利用对抗攻击的可迁移性,在黑盒环境下探测不可辨认的鲁棒性。这种具有挑战性的场景假设不可辨认方法未知且无法访问不可辨认模型进行优化,要求攻击能够在不同不可辨认模型之间实现迁移。具体而言,我们采用对抗搜索策略寻找可迁移 across 不同不可辨认模型的对抗嵌入。该策略以原始 Stable Diffusion 模型为代理模型,迭代擦除并搜索嵌入,从而找到能够为不同不可辨认方法恢复目标概念的嵌入。广泛实验表明,所搜索的对抗嵌入在多个最先进的不可辨认方法之间具有可迁移性,并且对不同程度的概念具有有效性。
引用
@article{arxiv.2404.19382,
title = {Probing Unlearned Diffusion Models: A Transferable Adversarial Attack Perspective},
author = {Xiaoxuan Han and Songlin Yang and Wei Wang and Yang Li and Jing Dong},
journal= {arXiv preprint arXiv:2404.19382},
year = {2024}
}