中文

Uni-paint:基于预训练扩散模型的多模态图像修复统一框架

计算机视觉与模式识别 2023-10-12 v1

摘要

近来,文本到图像去噪扩散概率模型(DDPMs)已展现出令人惊叹的图像生成能力,并成功应用于图像修复。然而在实践中,用户往往需要对修复过程有更多控制,而非仅依赖文本引导,尤其当他们希望合成具有定制外观、颜色、形状和布局的对象时。遗憾的是,现有基于扩散的修复方法局限于单模态引导且需要特定任务训练,阻碍了其跨模态可扩展性。为应对这些局限,我们提出Uni-paint,一种提供多种引导模式(包括无条件、文本驱动、笔触驱动、范例驱动修复以及这些模式的组合)的多模态修复统一框架。此外,我们的Uni-paint基于预训练的Stable Diffusion,无需在特定数据集上进行特定任务训练,从而实现对定制图像的少样本泛化能力。我们进行了广泛的定性与定量评估,结果表明我们的方法在取得与现有单模态方法相当结果的同时,提供了其他方法不具备的多模态修复能力。代码将发布于https://github.com/ysy31415/unipaint。

关键词

引用

@article{arxiv.2310.07222,
  title  = {Uni-paint: A Unified Framework for Multimodal Image Inpainting with Pretrained Diffusion Model},
  author = {Shiyuan Yang and Xiaodong Chen and Jing Liao},
  journal= {arXiv preprint arXiv:2310.07222},
  year   = {2023}
}

备注

Accepted by ACMMM'23