中文

DiffX:引导布局进行跨模态生成建模

计算机视觉与模式识别 2024-10-22 v5

摘要

扩散模型在语言驱动和布局驱动的图像生成方面取得了显著进展。然而,大多数扩散模型仅限于可见RGB图像的生成。事实上,人类对世界的感知是通过多样化视角丰富而的,例如色彩对比、热力学照明和深度信息。本文引入了一种新型用于通用布局引导的跨模态生成模型,称为DiffX。值得注意的是,我们的DiffX呈现出一种紧凑且有效的跨模态生成建模流程,在模态共享的潜在空间中进行扩散和去噪过程。此外,我们引入了联合模态嵌入器(Joint-Modality Embedder, JME),通过包含门控注意力机制来增强布局与文本条件之间的相互作用。为促进用户指导的训练,我们通过大型多模态模型(Large-Multimodal Model, LMM)和人类在环(human-in-the-loop)精炼构建了带有详细文本标题的跨模态图像数据集。通过大量实验,我们的DiffX在FLIR、MFNet和COME15K数据集上表现出对跨模态“RGB+X”图像生成的鲁健性,由各种布局条件引导。同时,它显示出在FLIR、MFNet、COME15K和MCXFace数据集上进行“RGB+X+Y(+Z)”图像或更多样化模态自适应生成的强大潜力。鉴于DiffX是首个用于布局引导的跨模态图像生成模型,我们的源码和构建的跨模态图像数据集已提供于https://github.com/zeyuwang-zju/DiffX。

关键词

引用

@article{arxiv.2407.15488,
  title  = {DiffX: Guide Your Layout to Cross-Modal Generative Modeling},
  author = {Zeyu Wang and Jingyu Lin and Yifei Qian and Yi Huang and Shicen Tian and Bosong Chai and Juncan Deng and Qu Yang and Lan Du and Cunjian Chen and Kejie Huang},
  journal= {arXiv preprint arXiv:2407.15488},
  year   = {2024}
}