中文

解构扩散变换器中指令对影响的细粒度控制

计算机视觉与模式识别 2025-04-08 v1

摘要

指令引导的图像编辑使用户能够使用自然语言指定修改,提供了更大的灵活性和控制力。虽然现有框架中,基于扩散变换器的模型在可扩展性和性能方面优于基于U-Net的扩散模型,但在实际场景中往往需要同时执行多个指令,分步编辑会导致累积误差和质量下降,单一提示整合多个指令通常会因指令冲突导致编辑不完整。我们提出指令影响解构(IID)框架,使其能够在单个去噪过程中实现多个指令的平行执行,专为基于DiT的模型设计。通过分析DiT中的自注意力机制,我们识别出多指令情境下的独特注意力模式,推导出针对每个指令的注意力掩码,以解构每个指令的影响。这些掩码引导编辑过程,确保局部修改的同时保持非编辑区域的一致性。在开源数据集和自定义数据集上的大量实验表明,IID在减少扩散步数、提高保真度和指令完成度方面优于现有基线方法。本文接受后将公开代码。

关键词

引用

@article{arxiv.2504.04784,
  title  = {Disentangling Instruction Influence in Diffusion Transformers for Parallel Multi-Instruction-Guided Image Editing},
  author = {Hui Liu and Bin Zou and Suiyun Zhang and Kecheng Chen and Rui Liu and Haoliang Li},
  journal= {arXiv preprint arXiv:2504.04784},
  year   = {2025}
}

备注

14 pages, 8 figures