中文

3DIS:面向文本到图像生成的深度驱动解耦实例合成

计算机视觉与模式识别 2025-12-03 v2

摘要

文本到图像生成中对可控输出的需求日益增长,推动了多实例生成(MIG)技术的进步,该技术允许用户定义实例布局和属性。然而,与ControlNet等图像条件生成方法不同,MIG技术尚未被SD2和SDXL等最先进模型广泛采用,这主要是由于构建能够同时处理实例定位和属性渲染的鲁棒渲染器存在挑战。本文介绍了深度驱动解耦实例合成(3DIS),这是一种新颖的框架,它将MIG过程解耦为两个阶段:(i) 生成粗略的场景深度图以实现精确的实例定位和场景构图,以及(ii) 在任何基础模型上使用预训练的ControlNet渲染细粒度属性,无需额外训练。我们的3DIS框架将一个定制适配器集成到LDM3D中,以实现精确的基于深度的布局,并采用一种免微调的方法来增强实例级属性渲染。在COCO-Position和COCO-MIG基准上的大量实验表明,3DIS在布局精度和属性渲染方面均显著优于现有方法。值得注意的是,3DIS与各种基础模型无缝兼容,为先进的多实例生成提供了鲁棒且适应性强的解决方案。代码可在 https://github.com/limuloo/3DIS 获取。

关键词

引用

@article{arxiv.2410.12669,
  title  = {3DIS: Depth-Driven Decoupled Instance Synthesis for Text-to-Image Generation},
  author = {Dewei Zhou and Ji Xie and Zongxin Yang and Yi Yang},
  journal= {arXiv preprint arXiv:2410.12669},
  year   = {2025}
}

备注

10 pages