中文

DesignEdit:面向统一且精确图像编辑的多层潜在分解与融合

计算机视觉与模式识别 2024-03-22 v1

摘要

近年来,如何实现精确的图像编辑引起了越来越多的关注,尤其是在文本到图像生成模型取得显著成功之后。为了将各种空间感知的图像编辑能力统一到一个框架中,我们借鉴了设计领域的图层概念,通过多种操作灵活地操控对象。其核心思想是将空间感知的图像编辑任务转化为两个子任务的组合:多层潜在分解与多层潜在融合。首先,我们将源图像的潜在表示分割为多个图层,其中包括若干对象层和一个需要可靠修复的不完整背景层。为了避免额外的调优,我们进一步探索了自注意力机制内部的修复能力。我们引入了一种键掩码自注意力方案,该方案可以将周围的上下文信息传播到掩码区域,同时减轻其对掩码外区域的影响。其次,我们提出了一种指令引导的潜在融合方法,将多层潜在表示粘贴到画布潜在上。我们还在潜在空间中引入了一种伪影抑制方案,以提高修复质量。由于这种多层表示固有的模块化优势,我们能够实现精确的图像编辑,并证明我们的方法持续超越了最新的空间编辑方法,包括 Self-Guidance 和 DiffEditor。最后,我们展示了我们的方法是一个统一的框架,支持超过六种不同编辑任务上的各种精确图像编辑。

关键词

引用

@article{arxiv.2403.14487,
  title  = {DesignEdit: Multi-Layered Latent Decomposition and Fusion for Unified & Accurate Image Editing},
  author = {Yueru Jia and Yuhui Yuan and Aosong Cheng and Chuke Wang and Ji Li and Huizhu Jia and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2403.14487},
  year   = {2024}
}

备注

technical report, 15 pages, webpage: https://design-edit.github.io/