扩散转换器中全局文本条件的重新思考
计算机视觉与模式识别
2026-02-11 v1
摘要
扩散转换器通常通过注意力层和基于池化文本嵌入的调制机制来融合文本信息。然而,近期方法放弃调制式文本条件,完全依赖注意力。在本文中,我们探讨了是否需要调制式文本条件,以及它是否能提供性能优势。我们的分析表明,在传统用法下,池化嵌入对整体性能贡献有限,表明注意力本身通常足以可靠地传递提示信息。然而,我们发现,当以不同视角使用池化嵌入时,能够显著提升性能——将其作为指导信号,实现对更可取属性的可控性转移。这一方法无需训练、实现简单,运行开销可忽略,可应用于各种扩散模型,在包括文本到图像/视频生成和图像编辑在内的各种任务中均带来改进。
引用
@article{arxiv.2602.09268,
title = {Rethinking Global Text Conditioning in Diffusion Transformers},
author = {Nikita Starodubcev and Daniil Pakhomov and Zongze Wu and Ilya Drobyshevskiy and Yuchen Liu and Zhonghao Wang and Yuqian Zhou and Zhe Lin and Dmitry Baranchuk},
journal= {arXiv preprint arXiv:2602.09268},
year = {2026}
}
备注
Accepted at ICLR26