中文

Prompt Reinjection:用于缓解多模态扩散变换器中提示词遗忘的做法

计算机视觉与模式识别 2026-05-21 v3

摘要

多模态扩散变换器(MMDiT)用于文本到图像生成时,保持独立的文本和图像分支,并在去噪过程中实现文本标记与视觉潜在表示之间的双向信息流。在此设置下,我们观察到提示词遗忘现象:随着深度增加,文本分支中提示词表示的语义会被逐渐遗忘。我们通过在文本分支中对三种代表性 MMDiT——SD3、SD3.5 和 FLUX.1 的各层进行语言属性探测,进一步验证了这一效果。针对此发现,我们引入一种无训练的方法——提示词重注入(prompt reinjection),将早期层的提示词表示重新注入到后期层,以缓解此遗忘。在 GenEval、DPG 和 T2I-CompBench++ 上的实验显示,该方法在指令遵循能力上 consistently 获得提升,并在捕捉偏好、审美以及整体文本-图像生成质量的指标上实现改进。

关键词

引用

@article{arxiv.2602.06886,
  title  = {Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers},
  author = {Yuxuan Yao and Yuxuan Chen and Hui Li and Kaihui Cheng and Qipeng Guo and Yuwei Sun and Zilong Dong and Jingdong Wang and Siyu Zhu},
  journal= {arXiv preprint arXiv:2602.06886},
  year   = {2026}
}

备注

19 pages