通过对抗搜索发现文本引导扩散模型的失效模式
计算机视觉与模式识别
2023-12-01 v5
摘要
文本引导扩散模型(TDMs)应用广泛,但可能意外失效。常见失败包括:(i)自然文本提示生成内容错误的图像,或(ii)尽管以同一文本提示为条件,潜在变量的不同随机采样却生成差异巨大甚至无关的输出。本工作中,我们旨在更细致地研究并理解TDMs的失效模式。为此,我们提出SAGE,首个针对TDMs的对抗搜索方法,其系统性地探索离散提示空间与高维潜在空间,自动发现图像生成中的不良行为与失败案例。我们在搜索中使用图像分类器作为代理损失函数,并借助人工检查验证所识别的失败。我们的方法首次实现对离散且复杂的人类语言空间及具挑战性的潜在空间的高效探索,克服了梯度消失问题。随后,我们在五个广泛使用的生成模型上展示SAGE的有效性,并揭示四种典型失效模式:(1)我们发现多种自然文本提示生成的图像未能捕捉输入文本的语义,并基于结果进一步讨论潜在原因与可能的解决方案。(2)我们发现潜在空间中导致与文本提示无关扭曲图像的区域,表明部分潜在空间结构不良。(3)我们还发现生成与文本提示无关自然图像的潜在样本,意味着潜在空间与提示空间间可能存在错位。(4)通过向任意输入提示追加单个对抗token嵌入,我们可生成多种指定目标物体。项目页:https://sage-diffusion.github.io/
引用
@article{arxiv.2306.00974,
title = {Discovering Failure Modes of Text-guided Diffusion Models via Adversarial Search},
author = {Qihao Liu and Adam Kortylewski and Yutong Bai and Song Bai and Alan Yuille},
journal= {arXiv preprint arXiv:2306.00974},
year = {2023}
}
备注
Project page: https://sage-diffusion.github.io/