中文

Griffin:基于生成参考与布局引导的图像组成

计算机视觉与模式识别 2025-10-01 v2

摘要

文本到图像模型已实现相当高的真实感,使得能够生成高度令人信服的图像。然而,基于文本的控制在需要更明确指导时可能是限制因素。定义内容及其在图像中的精确位置对于实现更细粒度的控制至关重要。本文解决了多图像布局控制的问题,即通过图像而非文本指定所需内容,并指导模型在图像中放置每个元素。我们的 approach 无需训练,仅需每个参考一个图像,即可提供对对象和部件级组成的明确且简单的控制。我们在 various 图像组成任务上展示了其有效性。

关键词

引用

@article{arxiv.2509.23643,
  title  = {Griffin: Generative Reference and Layout Guided Image Composition},
  author = {Aryan Mikaeili and Amirhossein Alimohammadi and Negar Hassanpour and Ali Mahdavi-Amiri and Andrea Tagliasacchi},
  journal= {arXiv preprint arXiv:2509.23643},
  year   = {2025}
}