FoolSDEdit:欺骗性地引导您的编辑朝向目标属性感知分布
计算机视觉与模式识别
2024-02-07 v1 密码学与安全
摘要
基于扩散模型的引导式图像合成方法(如 SDEdit)擅长根据用户的笔画输入创建逼真图像。然而,现有工作主要关注图像质量,常常忽略一个关键点:扩散模型代表的是数据分布,而非单张图像。这引入了一个虽低但至关重要的风险,即生成与用户意图相悖的图像,从而引发伦理问题。例如,用户输入一幅具有女性特征的笔画,SDEdit 可能以一定概率生成男性面孔。为暴露这一潜在漏洞,我们旨在构建一种对抗性攻击,迫使 SDEdit 生成与指定属性(如女性)对齐的特定数据分布,而不改变输入属性的特征。我们提出了目标属性生成攻击(TAGA),使用属性感知的目标函数并优化添加到输入笔画上的对抗性噪声。实证研究表明,传统的对抗性噪声难以应对 TAGA,而曝光和运动模糊等自然扰动则容易改变生成图像的属性。为执行有效攻击,我们引入了 FoolSDEdit:我们设计了一种联合对抗性曝光与模糊攻击,向笔画添加曝光和运动模糊并对其进行联合优化。我们将各种扰动的执行策略优化问题,构建为一个网络架构搜索问题。我们创建了 SuperPert,一个表示不同扰动执行策略的图。经过训练,我们获得了针对 SDEdit 的有效 TAGA 优化执行策略。在两个数据集上的综合实验表明,我们的方法能迫使 SDEdit 生成目标属性感知的数据分布,性能显著优于基线方法。
引用
@article{arxiv.2402.03705,
title = {FoolSDEdit: Deceptively Steering Your Edits Towards Targeted Attribute-aware Distribution},
author = {Qi Zhou and Dongxia Wang and Tianlin Li and Zhihong Xu and Yang Liu and Kui Ren and Wenhai Wang and Qing Guo},
journal= {arXiv preprint arXiv:2402.03705},
year = {2024}
}