中文

基于扩散模型的测试时条件文本到图像合成

计算机视觉与模式识别 2024-11-19 v1

摘要

我们考虑使用扩散模型进行条件文本到图像合成的问题。最近的大多数工作要么需要微调基础扩散模型的特定部分,要么需要引入新的可训练参数,由于需要训练,这导致了部署的不灵活性。为了填补当前文献中的这一空白,我们提出了一种名为 TINTIN 的方法:基于扩散模型的测试时条件文本到图像合成,这是一种新的免训练、纯测试时算法,用于将文本到图像扩散模型的输出条件化于调色板和边缘图等条件因素。具体而言,我们提出将去噪过程中的噪声预测解释为基于能量的模型的梯度,从而提供一种灵活的方法,通过将从中推断出的预测与真实条件输入相匹配来操纵噪声。据我们所知,这产生了第一种利用输入调色板控制模型输出的方法,我们使用一种新颖的颜色分布匹配损失来实现它。我们还表明,这种测试时噪声操纵可以轻松扩展到其他类型的条件,例如边缘图。我们使用各种文本提示、调色板和边缘图进行了大量实验,并在定性和定量上均证明了对当前 SOTA 的显著改进。

关键词

引用

@article{arxiv.2411.10800,
  title  = {Test-time Conditional Text-to-Image Synthesis Using Diffusion Models},
  author = {Tripti Shukla and Srikrishna Karanam and Balaji Vasan Srinivasan},
  journal= {arXiv preprint arXiv:2411.10800},
  year   = {2024}
}