中文

多模态扩散Transformer中概念遗漏的诊断与修正

计算机视觉与模式识别 2026-05-29 v2

摘要

多模态扩散Transformer(MM-DiTs)在文本到图像生成方面取得了显著进展,但它们经常出现概念遗漏问题,即指定的对象或属性未能出现在生成的图像中。通过对文本词元执行线性探测,我们证明文本嵌入能够区分出一种特征性的“遗漏信号”,代表目标概念的缺失。利用这一发现,我们提出了遗漏信号干预(OSI),该机制通过放大遗漏信号来主动催化缺失概念的生成。在 FLUX.1-Dev 和 SD3.5-Medium 上的综合实验表明,即使在极端场景下,OSI 也能显著缓解概念遗漏问题。

关键词

引用

@article{arxiv.2605.14270,
  title  = {Diagnosing and Correcting Concept Omission in Multimodal Diffusion Transformers},
  author = {Kanghyun Baek and Jaihyun Lew and Chaehun Shin and Jungbeom Lee and Sungroh Yoon},
  journal= {arXiv preprint arXiv:2605.14270},
  year   = {2026}
}

备注

Accepted to ICML 2026