中文

FreeFlux:理解并利用基于 RoPE 的 MMDiT 中的层级特定角色以实现多功能图像编辑

计算机视觉与模式识别 2025-03-21 v1

摘要

旋转位置编码在多模态扩散 Transformer(MMDiT)中的集成显著提升了文本到图像生成的质量。然而,在生成过程中,自注意力层对位置编码的依赖与对查询-键相似度的依赖这一根本问题仍然是一个引人入胜的疑问。我们首次对基于 RoPE 的 MMDiT 模型(例如 FLUX)进行了机制分析,引入了一种自动化探测策略,通过在生成过程中策略性地操纵 RoPE 来解耦位置信息与内容依赖。我们的分析揭示了与深度不直接相关的独特依赖模式,为基于 RoPE 的 MMDiT 中的层级特定角色提供了新见解。基于这些发现,我们提出了一个无需训练、特定于任务的图像编辑框架,将编辑任务分为三类:依赖位置的编辑(例如对象添加)、依赖内容相似度的编辑(例如非刚性编辑)和保留区域的编辑(例如背景替换)。对于每种类型,我们根据编辑任务的特征设计了量身定制的键值注入策略。广泛的定性和定量评估表明,我们的方法优于 state-of-the-art 方法,特别是在保留原始语义内容和实现无缝修改方面。

关键词

引用

@article{arxiv.2503.16153,
  title  = {FreeFlux: Understanding and Exploiting Layer-Specific Roles in RoPE-Based MMDiT for Versatile Image Editing},
  author = {Tianyi Wei and Yifan Zhou and Dongdong Chen and Xingang Pan},
  journal= {arXiv preprint arXiv:2503.16153},
  year   = {2025}
}

备注

Project page: https://wtybest.github.io/projects/FreeFlux/