中文

草图引导的文本到图像扩散模型

计算机视觉与模式识别 2022-11-28 v1 图形学 机器学习

摘要

文本到图像模型在机器学习的演进中引入了显著的飞跃,展示出根据给定文本提示高质量合成图像的能力。然而,这些强大的预训练模型仍缺乏可引导合成图像空间属性的控制手柄。在本工作中,我们引入一种通用方法,在推理时以来自另一域(如草图)的空间映射引导预训练的文本到图像扩散模型。与以往工作不同,我们的方法无需为任务训练专用模型或专用编码器。我们的核心思想是训练一个潜变量引导预测器(LGP)——一个微小的逐像素多层感知机(MLP),将噪声图像的潜特征映射到空间映射,其中深度特征提取自核心去噪扩散概率模型(DDPM)网络。LGP 仅在几千张图像上训练,构成一个可微的引导映射预测器,在其上计算损失并反向传播以推动中间图像与空间映射一致。逐像素训练提供了灵活性与局部性,使该技术能在域外草图上表现良好,包括自由手绘风格。我们特别关注草图到图像翻译任务,揭示了一种鲁棒且富有表现力的方式,以生成遵循任意风格或域的草图引导的图像。项目页面:sketch-guided-diffusion.github.io

关键词

引用

@article{arxiv.2211.13752,
  title  = {Sketch-Guided Text-to-Image Diffusion Models},
  author = {Andrey Voynov and Kfir Aberman and Daniel Cohen-Or},
  journal= {arXiv preprint arXiv:2211.13752},
  year   = {2022}
}