中文

论扩散模型的多模态脆弱性

机器学习 2025-01-06 v2 密码学与安全 计算机视觉与模式识别

摘要

扩散模型已广泛部署于各种图像生成任务中,展示了图像与文本模态之间的非凡联系。尽管先前的研究已分别从文本和图像模态的角度探讨了扩散模型的脆弱性,但当前的研究格局尚未彻底调查由多模态整合(特别是通过文本和视觉特征的联合分析)所产生的脆弱性。本文首次对扩散模型嵌入的文本和图像特征空间进行可视化,并观察到一个显著差异。提示词在文本特征空间中嵌入得杂乱无章,而在图像特征空间中则根据其主题聚类。这些有趣的发现可能揭示了扩散模型内部两种模态之间在鲁棒性上存在的潜在错位。基于这一观察,我们提出了MMP-Attack,它利用多模态先验(MMP),通过在原始提示词后附加特定后缀来操纵扩散模型的生成结果。具体来说,我们的目标是诱导扩散模型生成特定对象,同时消除原始对象。我们的MMP-Attack在操纵能力和效率上均优于现有研究,显示出显著优势。我们的代码已公开于 \url{https://github.com/ydc123/MMP-Attack}。

关键词

引用

@article{arxiv.2402.01369,
  title  = {On the Multi-modal Vulnerability of Diffusion Models},
  author = {Dingcheng Yang and Yang Bai and Xiaojun Jia and Yang Liu and Xiaochun Cao and Wenjian Yu},
  journal= {arXiv preprint arXiv:2402.01369},
  year   = {2025}
}

备注

Accepted at ICML2024 Workshop on Trustworthy Multi-modal Foundation Models and AI Agents (TiFA)