基于交叉注意力控制的提示到提示图像编辑
计算机视觉与模式识别
2022-08-03 v1 计算与语言
图形学
机器学习
摘要
近期大规模文本驱动合成模型因其生成高度多样且遵循给定文本提示的图像的卓越能力而备受关注。此类基于文本的合成方法对人类尤其具有吸引力,因为人们习惯于用语言描述意图。因此,将文本驱动图像合成扩展为文本驱动图像编辑是自然之举。对这些生成模型而言,编辑具有挑战性,因为编辑技术的固有特性是保留原始图像的大部分内容,而在基于文本的模型中,即便对文本提示稍作修改也常导致完全不同的结果。最先进的方法通过要求用户提供空间掩码来定位编辑从而缓解此问题,但这忽略了掩码区域内的原始结构与内容。本文中,我们追求一种直观的提示到提示编辑框架,其中编辑仅由文本控制。为此,我们深入分析了文本条件模型,并观察到交叉注意力层是控制图像空间布局与提示中每个词之间关系的关键。基于该观察,我们提出了若干仅通过编辑文本提示来监控图像合成的应用。这包括通过替换一个词进行局部编辑、通过添加说明进行全局编辑,甚至精细控制某个词在图像中的体现程度。我们在多样图像与提示上展示了结果,证明了高质量的合成以及对编辑后提示的保真度。
引用
@article{arxiv.2208.01626,
title = {Prompt-to-Prompt Image Editing with Cross Attention Control},
author = {Amir Hertz and Ron Mokady and Jay Tenenbaum and Kfir Aberman and Yael Pritch and Daniel Cohen-Or},
journal= {arXiv preprint arXiv:2208.01626},
year = {2022}
}