中文

理解文本到图像生成模型中的 implode 现象

密码学与安全 2024-09-20 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

近期研究表明,文本到图像生成模型对各种投毒攻击极其脆弱。经验结果发现,这些模型可以通过改变单个文本提示与其关联视觉特征之间的关联来被损坏。此外,多个并发投毒攻击可诱发“模型崩解”,即模型无法为未受投毒的提示生成有意义的图像。这一有趣的发现凸显了缺乏对这些模型投毒攻击的直观框架。本文建立了第一个针对图像生成模型抗投毒鲁棒性的分析框架,通过对潜在扩散模型中交叉注意力机制的行为进行建模与分析。我们将交叉注意力训练建模为一种抽象的“受监督图对齐”问题,并通过对齐难易度 (Alignment Difficulty, AD) 指标对训练数据的影响进行形式化量化。AD 值越高,对齐难度越大。随着 AD 的增长,对齐任务变得越来越困难,导致高度扭曲的结果,频繁地将有意义的文本提示映射到未定义或无意义的视觉表征中。结果是,生成模型崩解并输出随机、混乱的图像。我们通过大量实验验证了分析框架,并确认并解释了意想不到的(且此前未解释的)模型崩解现象,同时发现了新的、意想不到的见解。我们的工作为研究扩散模型及其防御的投毒攻击提供了有用的工具。

关键词

引用

@article{arxiv.2409.12314,
  title  = {Understanding Implosion in Text-to-Image Generative Models},
  author = {Wenxin Ding and Cathy Y. Li and Shawn Shan and Ben Y. Zhao and Haitao Zheng},
  journal= {arXiv preprint arXiv:2409.12314},
  year   = {2024}
}

备注

ACM CCS 2024