中文

Laytrol:在多模态扩散变换器中保持布局控制的预训练知识

计算机视觉与模式识别 2025-11-12 v1

摘要

随着扩散模型的发展,增强文本到图像生成中空间可控性已成为一个关键挑战。作为解决这一挑战的代表性任务,布局到图像生成旨在生成与给定布局条件在空间上一致的图像。现有的布局到图像方法通常通过将适配器模块集成到基础生成模型中来引入布局条件。然而,生成的图像常常表现出低视觉质量和风格不一致的情况,这表明预训练知识被丢失了。为缓解这一问题,我们构建了布局合成(LaySyn)数据集,该数据集利用基础模型自身合成的图像来缓解预训练数据与合成数据之间的分布偏移。此外,我们提出了布局控制(Laytrol)网络,其中参数继承自 MM-DiT,以保留基础模型的预训练知识。为有效激活复制的参数并避免不稳定控制条件的干扰,我们采用了专门的初始化方案。首先,布局编码器被初始化为纯文本编码器,以确保其输出标记 remain within MM-DiT 的数据域。其次,布局控制网络的输出被初始化为零。此外,我们将对象级旋转位置编码应用到布局标记,以提供粗糙的位置信息。定性和定量实验均证明了我们方法的有效性。

关键词

引用

@article{arxiv.2511.07934,
  title  = {Laytrol: Preserving Pretrained Knowledge in Layout Control for Multimodal Diffusion Transformers},
  author = {Sida Huang and Siqi Huang and Ping Luo and Hongyuan Zhang},
  journal= {arXiv preprint arXiv:2511.07934},
  year   = {2025}
}

备注

Accepted by AAAI 2026