中文

DiffMorph: 基于扩散模型的无文本图像变形

计算机视觉与模式识别 2024-01-02 v1 人工智能

摘要

文本条件图像生成模型是 AI 图像合成的普遍应用,然而由艺术家直观地控制输出仍具挑战。现有方法需要为每个物体提供多张图像和文本提示,将其指定为概念以生成单张定制图像。另一方面,我们的工作 DiffMorph 引入了一种新颖的方法,无需使用文本提示即可合成混合概念的图像。我们的工作集成了草图到图像模块,将用户草图作为输入纳入。DiffMorph 接收初始图像并结合艺术家绘制的草图条件,以生成变形图像。我们采用预训练的文本到图像扩散模型,并对其进行微调以忠实地重建每张图像。我们将图像和来自草图的概念无缝融合为一个连贯的构图。通过我们的结果以及与基于提示的图像生成的比较,展示了本工作的图像生成能力。

关键词

引用

@article{arxiv.2401.00739,
  title  = {DiffMorph: Text-less Image Morphing with Diffusion Models},
  author = {Shounak Chatterjee},
  journal= {arXiv preprint arXiv:2401.00739},
  year   = {2024}
}