稀有文本语义始终潜伏于您的扩散变换器中
人工智能
2025-10-07 v1
摘要
从流动和扩散基础变换器出发,多模态扩散变换器(MM-DiTs)已在文本到视觉生成领域取得显著进展,因其卓越的视觉保真度而备受赞誉。随着这些模型的不断进步,用户不断尝试创造性或稀有提示,但这些高级模型仍难以生成所需内容,因为其概念往往在预训练期间稀缺,难以形成强烈印象。本文提出一种简单且有效的干预方法,无需额外训练步骤、数据、去噪时间优化或依赖外部模块(如大型语言模型),即可在MM-DiTs中显现稀有语义。在 particular,MM-DiT固有的联合注意力机制在变换器块中依次更新文本嵌入和图像嵌入。我们发现,通过在联合注意力块之前对文本标记嵌入的表示域进行方差放大,可使稀有语义在MM-DiT的输出中清晰显现。此外,我们的结果在文本到视觉任务中效果广泛适用,包括文本到图像、文本到视频以及文本驱动的图像编辑。我们的工作邀请生成模型揭示用户意图所隐藏却待显现的语义。
引用
@article{arxiv.2510.03886,
title = {Rare Text Semantics Were Always There in Your Diffusion Transformer},
author = {Seil Kang and Woojung Han and Dayun Ju and Seong Jae Hwang},
journal= {arXiv preprint arXiv:2510.03886},
year = {2025}
}
备注
Accepted to NeurIPS 2025