InstanceAssemble:通过实例组装注意力实现布局感知的图像生成
计算机视觉与模式识别
2025-10-29 v2
摘要
扩散模型在生成高质量图像方面展现了卓越的能力。布局到图像(L2I)生成的最新进展利用位置条件和文本描述来促进精确且可控的图像合成。尽管取得了整体进展,当前的 L2I 方法仍表现出次优性能。因此,我们提出了 InstanceAssemble,一种新颖的架构,通过实例组装注意力引入布局条件,实现了基于边界框(bbox)的位置控制以及包括文本和额外视觉内容在内的多模态内容控制。我们的方法通过轻量级的 LoRA 模块实现了对现有基于 DiT 的 T2I 模型的灵活适配。此外,我们提出了一个布局到图像基准测试集 Denselayout,这是一个用于布局到图像生成的综合基准,包含 5k 张图像,总计 90k 个实例。我们进一步引入了布局定位分数(LGS),一种可解释的评估指标,以更精确地评估 L2I 生成的准确性。实验表明,我们的 InstanceAssemble 方法在复杂布局条件下达到了最先进的性能,同时展现出与多种风格 LoRA 模块的强大兼容性。代码和预训练模型已在 https://github.com/FireRedTeam/InstanceAssemble 上公开。
引用
@article{arxiv.2509.16691,
title = {InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention},
author = {Qiang Xiang and Shuang Sun and Binglei Li and Dejia Song and Huaxia Li and Nemo Chen and Xu Tang and Yao Hu and Junping Zhang},
journal= {arXiv preprint arXiv:2509.16691},
year = {2025}
}
备注
Accepted in NeurIPS 2025