中文

探索大语言模型与扩散变换器的深度融合用于文本到图像合成

计算机视觉与模式识别 2025-05-16 v1

摘要

本文并非描述一种新方法,而是对文本到图像合成领域近期进展中一个重要但尚未被充分研究的设计空间——即大语言模型(LLMs)与扩散变换器(DiTs)用于多模态生成的深度融合——进行了全面探索。先前的研究主要关注整体系统性能,而非与替代方法的详细比较,且关键设计细节和训练方案往往未公开披露。这些空白使得人们对该方法的真实潜力存在不确定性。为填补这些空白,我们对文本到图像生成进行了实证研究,与已有基线进行了受控比较,分析了的重要的设计选择,并提供了一个清晰、可复现的大规模训练方案。我们希望本工作能为多模态生成领域的未来研究提供有意义的数据点和实用指导。

关键词

引用

@article{arxiv.2505.10046,
  title  = {Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis},
  author = {Bingda Tang and Boyang Zheng and Xichen Pan and Sayak Paul and Saining Xie},
  journal= {arXiv preprint arXiv:2505.10046},
  year   = {2025}
}