P+:文本生成图像中的扩展文本条件化
计算机视觉与模式识别
2023-07-18 v3 计算与语言
图形学
机器学习
摘要
我们在文本生成图像模型中引入一个扩展文本条件化空间,称为 。该空间由来自逐层提示的多个文本条件构成,每个条件对应于扩散模型去噪 U-net 的一层。我们表明该扩展空间在图像合成上提供了更强的解耦与控制。我们进一步引入扩展文本反演(XTI),其中图像被反演到 中,并由逐层令牌表示。我们表明 XTI 比原始文本反演(TI)空间更具表现力与精确性,且收敛更快。该扩展反演方法在重建性与可编辑性之间不涉及任何明显权衡,并产生更规则的反演。我们进行了一系列广泛实验来分析并理解新空间的性质,并展示我们的方法在个性化文本生成图像模型中的有效性。此外,我们利用该空间的独特性质,使用文本生成图像模型实现了先前无法达成的对象-风格混合结果。项目页面:https://prompt-plus.github.io
引用
@article{arxiv.2303.09522,
title = {P+: Extended Textual Conditioning in Text-to-Image Generation},
author = {Andrey Voynov and Qinghao Chu and Daniel Cohen-Or and Kfir Aberman},
journal= {arXiv preprint arXiv:2303.09522},
year = {2023}
}