中文

面向高保真文本驱动编辑的任务导向扩散反转

计算机视觉与模式识别 2024-08-27 v1

摘要

近期文本引导扩散模型的发展解锁了强大的图像操控能力,但在实际图像上实现重建保真度与可编辑性之间的平衡仍是一个重大挑战。本 work 提出了一种新框架,即 Task-Oriented Diffusion Inversion(TODInv),该框架根据特定编辑任务对real images进行反转和编辑,通过在扩展的 P\mathcal{P}^* 空间中优化提示嵌入来实现。利用不同U-Net层和时间步的 distinct embeddings,TODInv seamless 集成了反转和编辑,通过互为优化,确保高保真度和精确的可编辑性。该分层编辑机制将任务分为结构、外观和全局编辑,仅优化受当前编辑任务影响不大的嵌入。广泛的基准数据集实验表明,TODInv 在现有方法上实现了性能的优越,提供了定量和定性的增强,同时展示了其与few-step扩散模型的多样性。

关键词

引用

@article{arxiv.2408.13395,
  title  = {Task-Oriented Diffusion Inversion for High-Fidelity Text-based Editing},
  author = {Yangyang Xu and Wenqi Shao and Yong Du and Haiming Zhu and Yang Zhou and Ping Luo and Shengfeng He},
  journal= {arXiv preprint arXiv:2408.13395},
  year   = {2024}
}