中文

DreamSteerer:利用个人化扩散模型提升源图像条件化编辑可编辑性

计算机视觉与模式识别 2024-10-31 v2 机器学习

摘要

最近的文本到图像个人化方法在给定少量图像的情况下显示出在教导扩散模型学习用户指定概念的巨大潜力,使这些概念能够在新情境中重用。针对个人化生成的大量工作,一个有前景的延伸是个人化编辑,即使用个人化概念编辑图像,这提供了比传统文本指导更精确的引导信号。为此,一个直接的解决方案是将个人化扩散模型与文本驱动的编辑框架集成。然而,这种方法常常在源图像上显示出不令人满意的可编辑性。为此,我们提出了DreamSteerer,这是一种用于增强现有文本到图像个人化方法的插件式方法。具体来说,我们通过一种新的“编辑驱动得分蒸馏”(EDSD)目标来增强个人化扩散模型的源图像条件化可编辑性。此外,我们识别了EDSD的一个模式陷阱问题,并提出了一种带有空间特征引导采样的模式偏移正则化以避免此问题。我们进一步对Delta去噪得分框架进行了两个关键修改,以实现与个人化概念相关的高保真局部编辑。广泛的实验结果验证了DreamSteerer能够显著提高几个文本到图像个人化基准的可编辑性,同时计算效率更高。

关键词

引用

@article{arxiv.2410.11208,
  title  = {DreamSteerer: Enhancing Source Image Conditioned Editability using Personalized Diffusion Models},
  author = {Zhengyang Yu and Zhaoyuan Yang and Jing Zhang},
  journal= {arXiv preprint arXiv:2410.11208},
  year   = {2024}
}

备注

Published as a conference paper at NeurIPS 2024