中文

UniCombine:基于 Diffusion Transformer 的统一多条件组合

计算机视觉与模式识别 2025-07-09 v2 人工智能

摘要

随着扩散模型在图像生成中的快速发展,对更强大、更灵活的可控框架的需求日益增加。尽管现有方法可以在文本提示之外引导生成,但有效组合多个条件输入同时保持与所有条件一致性的挑战仍未解决。为了解决这一问题,我们引入了 UniCombine,这是一个基于 DiT 的多条件可控生成框架,能够处理任意条件组合,包括但不限于文本提示、空间图和主体图像。具体而言,我们引入了一种新颖的条件 MMDiT 注意力机制,并结合了可训练的 LoRA 模块,以构建免训练和基于训练的版本。此外,我们提出了一种新的流水线来构建 SubjectSpatial200K,这是第一个专为多条件生成任务设计的数据集,涵盖了主体驱动和空间对齐条件。在多条件生成上的大量实验结果证明了我们方法的出色通用性和强大能力,并实现了最先进的性能。

关键词

引用

@article{arxiv.2503.09277,
  title  = {UniCombine: Unified Multi-Conditional Combination with Diffusion Transformer},
  author = {Haoxuan Wang and Jinlong Peng and Qingdong He and Hao Yang and Ying Jin and Jiafu Wu and Xiaobin Hu and Yanjie Pan and Zhenye Gan and Mingmin Chi and Bo Peng and Yabiao Wang},
  journal= {arXiv preprint arXiv:2503.09277},
  year   = {2025}
}