通过文本分割条件增强文本到图像扩散 Transformer
计算机视觉与模式识别
2026-04-15 v2 人工智能
摘要
当前的文本到图像扩散生成通常采用完整文本条件。由于复杂的语法,扩散 Transformer(DiT)在本质上存在对完整文本描述的理解缺陷。一次性的完整文本输入要么会忽略关键的语义细节,要么会因为同时建模多种语义基元类型而导致语义混淆。为了缓解 DiT 的这一缺陷,我们提出了一种名为 DiT-ST 的新型文本分割条件框架。该框架将完整文本描述转换为分割文本描述,即一组简化后的句子集合,以显式表达各种语义基元及其相互联系。随后,分割文本描述以分层和递增的方式注入到 DiT-ST 的不同去噪阶段中。具体而言,DiT-ST 利用大型语言模型解析描述,提取多种基元,并分层梳理和构建这些基元以形成分割文本输入。此外,我们根据扩散去噪过程对不同语义基元类型的差异性敏感度对其进行划分,并确定合适的时间步,通过交叉注意力将不同语义基元类型的 token 递增地注入到输入 token 中。通过这种方式,DiT-ST 增强了不同阶段特定语义基元类型的表示学习。大量实验验证了我们提出的 DiT-ST 在缓解完整文本理解缺陷方面的有效性。
引用
@article{arxiv.2505.19261,
title = {Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning},
author = {Yu Zhang and Jialei Zhou and Xinchen Li and Qi Zhang and Zhongwei Wan and Tianyu Wang and Duoqian Miao and Changwei Wang and Longbing Cao},
journal= {arXiv preprint arXiv:2505.19261},
year = {2026}
}
备注
NeurIPS 2025