中文

基于扩散模型的迭代多粒度图像编辑

计算机视觉与模式识别 2023-10-31 v2 人工智能 机器学习

摘要

近期文本引导图像合成方面的进展极大地改变了创意专业人士生成艺术性和美观视觉资产的方式。为充分支持此类创作,该过程应具备以下能力:1)迭代编辑生成结果;2)控制所需修改的空间范围(全局、局部或介于两者之间)。我们将这一务实的问题设定形式化为迭代多粒度编辑。尽管基于扩散的模型在图像合成与编辑方面已取得实质性进展,但它们均为一次性(即无迭代编辑能力),且不能自然产生多粒度控制(即覆盖从局部到全局编辑的全谱)。为克服这些缺陷,我们提出 EMILIE:迭代多粒度图像编辑器。EMILIE 引入了一种新颖的潜空间迭代策略,其重新利用预训练扩散模型以促进迭代编辑。辅以用于多粒度控制的梯度控制操作。我们引入了一个新的基准数据集来评估我们新提出的设定。我们针对适配于我们任务的最新方法进行了详尽的定量与定性评估,以彰显 EMILIE 的实力。我们希望我们的工作能吸引人们关注这一新发现的务实问题设定。

关键词

引用

@article{arxiv.2309.00613,
  title  = {Iterative Multi-granular Image Editing using Diffusion Models},
  author = {K J Joseph and Prateksha Udhayanan and Tripti Shukla and Aishwarya Agarwal and Srikrishna Karanam and Koustava Goswami and Balaji Vasan Srinivasan},
  journal= {arXiv preprint arXiv:2309.00613},
  year   = {2023}
}

备注

Accepted to IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2024