中文

基于实例级指令的图像生成:InstanceGen

计算机视觉与模式识别 2025-05-20 v3

摘要

尽管生成模型能力取得了快速进步,预训练文本到图像模型仍在捕捉由复杂提示所传递的语义方面存在挑战,这些提示包含多个对象和实例级属性。因此,人们开始关注集成额外的结构约束,通常以粗糙的边界框形式,作为更好的引导来生成这些具有挑战性的情形。在本工作中,我们进一步深化了结构引导的想法,观察到当代图像生成模型可以直接提供可靠的细粒度结构初始化。我们提出了一种技术方法,将这种基于图像的结构引导与基于LLM的实例级指令相结合,生成遵循文本提示中所有部分的输出图像,包括对象数量、实例级属性以及实例之间的空间关系。

关键词

引用

@article{arxiv.2505.05678,
  title  = {InstanceGen: Image Generation with Instance-level Instructions},
  author = {Etai Sella and Yanir Kleiman and Hadar Averbuch-Elor},
  journal= {arXiv preprint arXiv:2505.05678},
  year   = {2025}
}

备注

Accepted to SIGGRAPH 2025. Project page: https://tau-vailab.github.io/InstanceGen/