中文

扩散 Transformer 中的潜在空间解耦实现精确零样本语义编辑

计算机视觉与模式识别 2024-11-14 v1

摘要

扩散 Transformer (DiTs) 近期在文本引导的图像生成中取得了显著成功。在图像编辑中,DiT 将文本和图像输入投影到一个联合潜在空间,并从中解码合成新图像。然而,多模态信息如何共同形成这一联合空间,以及它们如何引导合成图像的语义,在很大程度上仍未被探索。本文研究了 DiT 模型的潜在空间,揭示了两项关键特性:第一,DiT 的潜在空间本质上是语义解耦的,不同的语义属性可由特定的编辑方向控制。第二,一致的语义编辑需要利用整个联合潜在空间,因为单独的编码图像或文本都不包含足够的语义信息。我们证明,这些编辑方向可直接从文本提示中获得,从而无需额外训练或掩码标注即可实现精确的语义控制。基于这些见解,我们提出了一种简单而有效的编码-识别-操纵 (EIM) 框架,用于零样本细粒度图像编辑。具体而言,我们首先对给定的源图像和描述该图像的文本提示进行编码,以获得联合潜在嵌入。然后,利用我们提出的 Hessian 分数蒸馏采样 (HSDS) 方法,识别出控制特定目标属性同时保留其他图像特征的编辑方向。这些方向由文本提示引导,并用于操纵潜在嵌入。此外,我们提出了一种新的度量标准来量化扩散模型潜在空间的解耦程度。在我们新整理的基准数据集上的大量实验结果和分析,证明了 DiT 的解耦特性以及 EIM 框架的有效性。

关键词

引用

@article{arxiv.2411.08196,
  title  = {Latent Space Disentanglement in Diffusion Transformers Enables Precise Zero-shot Semantic Editing},
  author = {Zitao Shuai and Chenwei Wu and Zhengxu Tang and Bowen Song and Liyue Shen},
  journal= {arXiv preprint arXiv:2411.08196},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2408.13335