中文

基于可微最优传输的同步多提示引导生成

计算机视觉与模式识别 2022-04-20 v1 图形学 机器学习

摘要

深度学习的最新进展,如强大的生成模型与联合文本-图像嵌入,为计算创造力社区提供了新的工具,为艺术追求开辟了新视角。由文本线索生成图像的文字到图像合成方法即为一例。这些图像通过潜向量生成,该向量被逐步优化以与文本线索一致。为此,在生成图像内采样图像块,并在公共文本-图像嵌入空间中与文本提示进行比较;随后使用梯度下降更新潜向量,以减小这些图像块与文本提示之间的平均(均值)距离。尽管该方法为艺术家提供了充分自由,可通过选择生成模型定制图像整体外观,但对简单准则(距离均值)的依赖常导致模式崩塌:整个图像被拉向所有文本线索的平均值,从而丧失其多样性。为解决此问题,我们提出使用最优传输(OT)文献中的匹配技术,使图像能够忠实反映广泛的提示多样性。我们提供了大量图示表明OT避免了基于均值距离估计向量所产生的一些缺陷,并在定性与定量实验中展示了所提方法的更优性能。

关键词

引用

@article{arxiv.2204.08472,
  title  = {Simultaneous Multiple-Prompt Guided Generation Using Differentiable Optimal Transport},
  author = {Yingtao Tian and Marco Cuturi and David Ha},
  journal= {arXiv preprint arXiv:2204.08472},
  year   = {2022}
}

备注

Accepted at ICCC 2022