中文

GrounDiT:基于含噪图像块移植的 Diffusion Transformer 空间定位

计算机视觉与模式识别 2024-11-04 v2

摘要

我们提出了 GrounDiT,一种用于 Diffusion Transformer (DiT) 文本到图像生成的无需训练的空间定位技术。基于边界框的空间定位因其简单性和通用性而受到关注,能够增强用户对图像生成的控制能力。然而,现有的无需训练的方法通常依赖于在逆扩散过程中通过自定义损失函数的反向传播来更新含噪图像,这往往难以实现对各个边界框的精确控制。在本工作中,我们利用 Transformer 架构的灵活性,证明了 DiT 能够生成对应于每个边界框的含噪图像块,这些图像块完全编码了目标对象,从而允许对每个区域进行细粒度控制。我们的方法建立在 DiT 的一个有趣性质之上,我们将其称为语义共享。由于语义共享,当一个较小的图像块与一个可生成尺寸的图像一起联合去噪时,两者会成为语义克隆体。每个图像块在生成过程的独立分支中进行去噪,然后在每个时间步被移植到原始含噪图像的对应区域,从而为每个边界框实现稳健的空间定位。在 HRS 和 DrawBench 基准上的实验中,与以往的无需训练方法相比,我们取得了 SOTA 的性能。

关键词

引用

@article{arxiv.2410.20474,
  title  = {GrounDiT: Grounding Diffusion Transformers via Noisy Patch Transplantation},
  author = {Phillip Y. Lee and Taehoon Yoon and Minhyuk Sung},
  journal= {arXiv preprint arXiv:2410.20474},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024. Project Page: https://groundit-diffusion.github.io/