中文

基于扩散模型的绘画式图像调和

计算机视觉与模式识别 2023-08-07 v1

摘要

绘画式图像调和旨在将照片物体插入画作中并获得艺术上协调的复合图像。该任务的先前方法主要依赖推理优化或生成对抗网络,但它们要么非常耗时,要么难以对前景物体(例如纹理和内容细节)进行精细控制。为解决这些问题,我们提出了一种新颖的绘画式调和稳定扩散模型(PHDiffusion),其包含一个轻量级自适应编码器和双编码器融合(DEF)模块。具体而言,自适应编码器和 DEF 模块首先在每个编码器内对前景特征进行风格化。然后,来自两个编码器的风格化前景特征被组合以引导调和过程。在训练期间,除扩散模型中的噪声损失外,我们还额外采用内容损失和两种风格损失,即 AdaIN 风格损失和对比风格损失,以平衡风格迁移与内容保留之间的权衡。与来自相关领域的最先进模型相比,我们的 PHDiffusion 能更充分地风格化前景并同时保留更精细的内容。我们的代码和模型可在 https://github.com/bcmi/PHDiffusion-Painterly-Image-Harmonization 获取。

关键词

引用

@article{arxiv.2308.02228,
  title  = {Painterly Image Harmonization using Diffusion Model},
  author = {Lingxiao Lu and Jiangtong Li and Junyan Cao and Li Niu and Liqing Zhang},
  journal= {arXiv preprint arXiv:2308.02228},
  year   = {2023}
}

备注

Accepted by ACMMM 2023