中文

DreamRenderer:驾驭大规模文本到图像模型中的多实例属性控制

计算机视觉与模式识别 2025-04-15 v2

摘要

图像条件生成方法,如深度和 canny 条件方法,已显示出惊人的精确图像合成能力。然而,现有模型仍在准确控制多个实例(或区域)内容方面存在挑战。即便是 FLUX 和 3DIS 这类最先进的模型,也面临属性在实例之间泄漏的问题,这限制了用户的控制能力。为解决这些问题,我们引入 DreamRenderer,这是一个建立在 FLUX 模型之上的无训练方法。DreamRenderer 允许用户通过边界框或掩码控制每个实例的内容,同时确保整体视觉和谐。我们提出了两个关键创新:1) 用于硬文本属性绑定的桥接图像标记 (Bridge Image Tokens),该方法使用复制的图像标记作为桥接标记,确保 T5 文本嵌入(仅基于文本数据预训练)在联合注意力期间为每个实例绑定正确的视觉属性;2) 仅应用于关键层的硬图像属性绑定。通过对 FLUX 的分析,我们识别了负责实例属性渲染的关键层,并在这些层中应用硬图像属性绑定,在其他层中使用软绑定。该方法确保了精确的控制,同时保持了图像质量。在 COCO-POS 和 COCO-MIG 基准测试中的评估表明,DreamRenderer 比 FLUX 在图像成功率上提高了 17.7%,并在布局到图像模型如 GLIGEN 和 3DIS 的性能上提升了最高达 26.8%。项目页面:https://limuloo.github.io/DreamRenderer/。

关键词

引用

@article{arxiv.2503.12885,
  title  = {DreamRenderer: Taming Multi-Instance Attribute Control in Large-Scale Text-to-Image Models},
  author = {Dewei Zhou and Mingwei Li and Zongxin Yang and Yi Yang},
  journal= {arXiv preprint arXiv:2503.12885},
  year   = {2025}
}

备注

11 pages