3DIS-FLUX:基于 DiT 渲染的简单高效多实例生成
计算机视觉与模式识别
2025-01-10 v1
摘要
可控输出在文本到图像生成中日益增长的需求,推动了多实例生成 (MIG) 的显著进展,使用户能够定义实例布局和属性。当前 MIG 的 SOTA 方法主要基于适配器,但这些方法需要在每次发布更先进模型时重新训练新的适配器,导致巨大的资源消耗。已提出一种名为 Depth-Driven Decoupled Instance Synthesis (3DIS) 的方法,将 MIG 解耦为两个 distinct 阶段:1) 基于深度的场景构建和 2) 使用广泛预训练深度控制模型进行细节渲染。3DIS 方法仅在场景构建阶段需要适配器训练,而 enables 各种模型进行 training-free 细节渲染。最初,3DIS 专注于利用 U-Net 架构(如 SD1.5、SD2 和 SDXL)的渲染技术,未探索最新 DiT 模型如 FLUX 的潜力。本文提出了 3DIS-FLUX,将 FLUX 模型集成到 3DIS 框架中以实现增强的渲染能力。具体而言,我们采用 FLUX.1-Depth-dev 模型进行深度图受控图像生成,并引入一种 detail renderer,其基于布局信息操作 FLUX 中 Joint Attention 机制的 Attention Mask。该方法允许对每个实例的细粒度属性进行精确渲染。我们的实验结果表明,3DIS-FLUX 利用 FLUX 模型在原 3DIS 方法(使用 SD2 和 SDXL)以及当前 MIG 的 SOTA 方法中在性能和图像质量方面均显著优于后者。项目页面:https://limuloo.github.io/3DIS/。
引用
@article{arxiv.2501.05131,
title = {3DIS-FLUX: simple and efficient multi-instance generation with DiT rendering},
author = {Dewei Zhou and Ji Xie and Zongxin Yang and Yi Yang},
journal= {arXiv preprint arXiv:2501.05131},
year = {2025}
}
备注
tech report