中文

文本引导的场景草图到照片合成

计算机视觉与模式识别 2023-02-15 v1

摘要

我们提出了一种带文本引导的场景级草图到照片合成方法。尽管物体级草图到照片合成已被广泛研究,但在没有充分反映目标风格的参考照片时,整个场景的合成仍然具有挑战性。为此,我们利用近期大规模预训练生成模型中的知识,实现了无需参考图像、由文本引导的草图到照片合成。为训练我们的模型,我们使用一组照片进行自监督学习。具体而言,我们使用预训练的边缘检测器将彩色图像和草图图像都映射到标准化的边缘域,从而缩小基于照片的边缘图像(训练时)与手绘草图图像(推理时)之间的差距。我们通过用草图和文本条件微调潜扩散模型(即 Stable Diffusion)来实现我们的方法。实验表明,所提方法能将并非从彩色图像提取的原始草图图像转换为具有引人注目的视觉质量的照片。

关键词

引用

@article{arxiv.2302.06883,
  title  = {Text-Guided Scene Sketch-to-Photo Synthesis},
  author = {AprilPyone MaungMaung and Makoto Shing and Kentaro Mitsui and Kei Sawada and Fumio Okura},
  journal= {arXiv preprint arXiv:2302.06883},
  year   = {2023}
}