中文

GLoD:在图像生成中组合全局上下文与局部细节

计算机视觉与模式识别 2024-04-25 v1 人工智能

摘要

扩散模型已展现出从文本提示合成高质量且多样化图像的能力。然而,同时控制全局上下文(例如物体布局和相互作用)和局部细节(例如颜色和情感)仍然是一个显著的挑战。模型往往难以理解涉及多个对象的复杂描述,并将指定的视觉属性反映到错误的目标上,或忽略它们。本文提出了 Global-Local Diffusion(\textit{GLoD}),一种新框架,允许在无需训练或微调的情况下同时控制文本到图像生成中的全局上下文和局部细节。它将多个全局和局部提示分配给相应的层,并使用预训练扩散模型将其噪声组合以引导去噪过程。我们的框架实现了复杂的全局-局部组合,在全局提示中条件化对象,同时保持其他未指定的身份。我们的定量和定性评估表明,GLoD 有效地生成符合用户提供的物体相互作用和物体细节的复杂图像。

关键词

引用

@article{arxiv.2404.15447,
  title  = {GLoD: Composing Global Contexts and Local Details in Image Generation},
  author = {Moyuru Yamada},
  journal= {arXiv preprint arXiv:2404.15447},
  year   = {2024}
}