LAMIC:基于多模态扩散 Transformer 可扩展性的布局感知多图像合成
计算机视觉与模式识别
2025-12-24 v2
摘要
在可控图像合成中,如何从多幅参考图像生成具有空间布局感知且连贯一致的图像,仍是一个尚未解决的难题。我们提出 LAMIC——一种布局感知的多图像合成框架,首次以免训练(training-free)方式将单参考扩散模型扩展到多参考场景。LAMIC 基于 MMDiT 模型构建,引入了两种即插即用的注意力机制:1) 组隔离注意力(Group Isolation Attention,GIA),用于增强实体解耦;2) 区域调制注意力(Region-Modulated Attention,RMA),用于实现布局感知生成。为全面评估模型能力,我们进一步提出三项指标:1) 包含比(Inclusion Ratio,IN-R)与填充比(Fill Ratio,FI-R),用于评估布局控制能力;2) 背景相似度(Background Similarity,BG-S),用于衡量背景一致性。大量实验表明,LAMIC 在大多数主要指标上达到了当前最优(state-of-the-art)性能:在所有设置下,其 ID-S、BG-S、IN-R 与 AVG 得分均稳定优于现有多参考基线,并在复杂合成任务中取得了最佳 DPG。上述结果表明,LAMIC 在身份保持、背景保留、布局控制与提示词遵循方面均具有卓越能力,且无需任何训练或微调,展现出强大的零样本泛化能力。通过继承先进单参考模型的优势并实现向多图像场景的无缝扩展,LAMIC 建立了可控多图像合成的一种全新免训练范式。随着基础模型的持续演进,LAMIC 的性能有望随之进一步提升。代码实现已开源,地址为:https://github.com/Suchenl/LAMIC。
引用
@article{arxiv.2508.00477,
title = {LAMIC: Layout-Aware Multi-Image Composition via Scalability of Multimodal Diffusion Transformer},
author = {Yuzhuo Chen and Zehua Ma and Jianhua Wang and Kai Kang and Shunyu Yao and Weiming Zhang},
journal= {arXiv preprint arXiv:2508.00477},
year = {2025}
}
备注
8 pages, 5 figures, 3 tables