用于免训练文本到图像生成的涂鸦引导扩散
计算机视觉与模式识别
2024-09-13 v1
摘要
近期文本到图像扩散模型的进展取得了显著成功,但它们往往难以完全捕捉用户的意图。使用文本输入结合边界框或区域掩码的现有方法在提供精确的空间引导方面存在不足,常常导致对象朝向错位或非预期。为了解决这些局限性,我们提出了涂鸦引导扩散(Scribble-Guided Diffusion, ScribbleDiff),这是一种免训练方法,利用用户提供的简单涂鸦作为视觉提示来引导图像生成。然而,由于涂鸦稀疏且纤细的特性,将涂鸦纳入扩散模型带来了挑战,使得难以确保准确的朝向对齐。为了克服这些挑战,我们引入了矩对齐和涂鸦传播,这使得生成图像与涂鸦输入之间能够实现更有效、更灵活的对齐。在 PASCAL-Scribble 数据集上的实验结果表明,在空间控制和一致性方面有显著改善,展示了基于涂鸦的引导在扩散模型中的有效性。我们的代码可在 https://github.com/kaist-cvml-lab/scribble-diffusion 获取。
引用
@article{arxiv.2409.08026,
title = {Scribble-Guided Diffusion for Training-free Text-to-Image Generation},
author = {Seonho Lee and Jiho Choi and Seohyun Lim and Jiwook Kim and Hyunjung Shim},
journal= {arXiv preprint arXiv:2409.08026},
year = {2024}
}