中文

ConsistCompose:用于图像组成的统一多模态布局控制

计算机视觉与模式识别 2026-03-17 v3

摘要

将视觉理解与图像生成耦合的统一多模态模型正在快速发展,但大多数系统仍专注于视觉锚定——将语言与图像区域对齐——而其生成对手,即语言嵌入布局——用于布局可控的多实例生成(LELG),仍未得到充分探索,这限制了精确的组成控制。我们提出ConsistCompose,一个统一的多模态框架,将布局坐标直接嵌入语言提示中,实现从交错图像-文本中的布局控制下的多实例图像生成。我们进一步构建了ConsistCompose3M数据集,包含340万个具有布局和身份标注的多实例生成数据集(包含260万个文本引导的数据对和80万个图像引导的数据对),为布局条件生成提供大规模监督。在该框架下,通过实例坐标绑定提示和坐标感知无条件引导实现了LELG,这将语言布局线索转化为精确的空间控制,而无需特定的任务分支。在COCO-Position和MS-Bench上的实验表明,ConsistCompose在布局控制基线上显著提高了空间准确性,同时保持了身份保真度和具竞争力的通用多模态理解能力,建立了布局可控多模态图像生成的统一范式。

关键词

引用

@article{arxiv.2511.18333,
  title  = {ConsistCompose: Unified Multimodal Layout Control for Image Composition},
  author = {Xuanke Shi and Boxuan Li and Xiaoyang Han and Zhongang Cai and Lei Yang and Quan Wang and Dahua Lin},
  journal= {arXiv preprint arXiv:2511.18333},
  year   = {2026}
}

备注

Accepted to CVPR 2026; 23 pages, 17 figures