中文

Seg4Diff:揭示文本到图像扩散变换器中的开放词汇分割

计算机视觉与模式识别 2025-09-23 v1

摘要

文本到图像扩散模型在通过其跨模态注意力机制在文本概念上潜在地对齐,从而卓越地将语言提示翻译为照片实在图像。最近的多模态扩散变换器通过在拼接后的图像和文本 Token 上引入联合自注意力,实现了更丰富且更可扩展的跨模态对齐。然而,关于这些注意力图如何贡献于图像生成的详细理解仍有限。本文提出了 Seg4Diff(Segmentation for Diffusion),这是一个用于分析 MM-DiT 注意力结构的系统框架,重点关注特定层如何将文本语义信息传递到图像中。通过全面分析,我们识别出一种语义对齐专家层,一种特定的 MM-DiT 块持续地将文本 Token 与具有空间连贯性的图像区域对齐,自然产生高质量的语义分割掩码。我们进一步演示了通过应用带有掩码注释的图像数据的轻量级微调方案,可增强这些层的语义分组能力,从而提高分割性能和生成图像的保真度。我们的发现表明,语义分组是扩散变换器的一种现象属性,可以被选择性放大,以推进分割和生成性能,为连接视觉感知和生成的统一模型之路。

关键词

引用

@article{arxiv.2509.18096,
  title  = {Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers},
  author = {Chaehyun Kim and Heeseong Shin and Eunbeen Hong and Heeji Yoon and Anurag Arnab and Paul Hongsuck Seo and Sunghwan Hong and Seungryong Kim},
  journal= {arXiv preprint arXiv:2509.18096},
  year   = {2025}
}

备注

NeurIPS 2025. Project page: https://cvlab-kaist.github.io/Seg4Diff/