中文

扩散变换器中的潜在空间解耦赋予零样本细粒度语义编辑能力

计算机视觉与模式识别 2024-08-27 v1

摘要

扩散变换器(DiT)在多样且高质量的文本到图像(T2I)生成中取得了显著的成功。然而,文本和图像潜在空间在何种方式以及如何共同贡献于生成图像的语义,仍然鲜有探索。通过对 DiT 潜在空间的研究,我们发现了 unlocking zero-shot fine-grained semantic editing 关键潜力的若干发现:(1)文本和图像空间在 DiT 中本质上是可分解的。(2)这些空间共同构成一种解耦语义表示空间,实现精确且细粒度的语义控制。(3)有效的图像编辑需要同时运用文本和图像潜在空间。基于这些洞见,我们提出了一种简单且高效的 Extract-Manipulate-Sample(EMS)框架,用于零样本细粒度图像编辑。我们的 метод 首先利用多模态大型语言模型将输入图像和编辑目标转换为文本描述。随后,基于所需的编辑程度对文本嵌入进行线性操作,并采用受约束的得分蒸馏采样来操作图像嵌入。我们提出了一种新度量标准,用于量化扩散模型潜在空间的解耦程度。为评估细粒度编辑性能,我们引入了包含人工标注、手动评估和自动评估指标的全面基准。我们进行了大量实验和深入分析,以彻底揭示扩散变换器语义解耦属性以及我们所提出方法的有效性。我们的标注基准数据集已公开发布于 https://anonymous.com/anonymous/EMS-Benchmark,促进该领域的可重复研究。

关键词

引用

@article{arxiv.2408.13335,
  title  = {Latent Space Disentanglement in Diffusion Transformers Enables Zero-shot Fine-grained Semantic Editing},
  author = {Zitao Shuai and Chenwei Wu and Zhengxu Tang and Bowen Song and Liyue Shen},
  journal= {arXiv preprint arXiv:2408.13335},
  year   = {2024}
}