中文

Design Booster:一种用于保持空间布局的图像翻译的文本引导扩散模型

计算机视觉与模式识别 2023-02-07 v1 人工智能

摘要

扩散模型能够在任意场景中生成逼真的图像。然而,在将扩散模型应用于图像翻译时,存在保持空间结构与高质量内容之间的权衡。此外,现有方法主要基于测试时优化或为每个输入图像微调模型,这对于实际应用来说极其耗时。为了解决这些问题,我们提出了一种通过学习布局感知的图像条件以及文本条件来实现灵活图像翻译的新方法。具体来说,我们的方法在训练阶段将图像和文本共同编码到一个新的域中。在推理阶段,我们可以为每个时间步选择图像、文本或两者作为条件,这使用户能够更灵活地控制布局和内容。我们方法的最先进方法的实验比较表明,我们的模型在风格图像翻译和语义图像翻译方面都表现最佳,并且耗时最短。

关键词

引用

@article{arxiv.2302.02284,
  title  = {Design Booster: A Text-Guided Diffusion Model for Image Translation with Spatial Layout Preservation},
  author = {Shiqi Sun and Shancheng Fang and Qian He and Wei Liu},
  journal= {arXiv preprint arXiv:2302.02284},
  year   = {2023}
}