中文

探索多模态扩散Transformer以增强基于提示的图像编辑

计算机视觉与模式识别 2025-08-12 v1

摘要

基于Transformer的扩散模型最近已取代了传统的 U-Net 架构,多模态扩散Transformer(MM-DiT)已成为 Stable Diffusion 3 和 Flux.1 等最先进模型中的主导方法。先前的方法依赖于单向交叉注意力机制,信息从文本嵌入流向图像潜变量。相比之下,MMDiT 引入了一种统一的注意力机制,它将来自两种模态的输入投影连接起来,并执行一次完整的注意力操作,允许文本和图像分支之间的双向信息流。这种架构转变对现有的编辑技术提出了重大挑战。在本文中,我们通过将注意力矩阵分解为四个不同的块来系统分析 MM-DiT 的注意力机制,揭示了它们的内在特性。通过这些分析,我们为 MM-DiT 提出了一种鲁棒的、基于提示的图像编辑方法,该方法支持跨各种 MM-DiT 变体(包括少步模型)的全局到局部编辑。我们相信,我们的发现弥合了现有基于 U-Net 的方法与新兴架构之间的差距,为 MMDiT 的行为模式提供了更深入的见解。

关键词

引用

@article{arxiv.2508.07519,
  title  = {Exploring Multimodal Diffusion Transformers for Enhanced Prompt-based Image Editing},
  author = {Joonghyuk Shin and Alchan Hwang and Yujin Kim and Daneul Kim and Jaesik Park},
  journal= {arXiv preprint arXiv:2508.07519},
  year   = {2025}
}

备注

ICCV 2025. Project webpage: https://joonghyuk.com/exploring-mmdit-web/