用于生成名人交互深度伪造的文本-图像引导扩散模型
计算机视觉与模式识别
2023-09-27 v1
摘要
深度伪造图像因其逼真性正迅速成为严重隐患。扩散模型近来展现出高度逼真的视觉内容生成能力,这使其成为深度伪造生成的极佳潜在工具。为遏制其被用于深度伪造,必须首先探究扩散模型在多大程度上可生成可由便捷提示词控制的逼真内容。本文在此方面设计并探究了一种新方法。我们的技术改进了流行的stable diffusion模型,以根据文本与图像提示生成可控的高质量深度伪造图像。此外,原始stable模型在生成含多人的高质量图像方面严重欠缺。改进后的扩散模型能够解决该问题,它在推理开始时加入输入锚图像的潜变量,而非以高斯随机潜变量作为输入。因此,我们专注于生成名人交互的伪造内容,这可能被用于传播谣言。我们还应用Dreambooth来增强伪造图像的真实感。Dreambooth训练中心词与特定特征的配对,以产生更精细且个性化的输出图像。我们的结果表明,借助所设计 scheme,有可能创造出具有惊人真实感的伪造视觉内容,以至于这些内容可作为有权势政治人物之间会面的可信证据。
引用
@article{arxiv.2309.14751,
title = {Text-image guided Diffusion Model for generating Deepfake celebrity interactions},
author = {Yunzhuo Chen and Nur Al Hasan Haldar and Naveed Akhtar and Ajmal Mian},
journal= {arXiv preprint arXiv:2309.14751},
year = {2023}
}
备注
8 pages,8 figures, DICTA