FreeCompose:基于扩散先验的通用零样本图像合成
计算机视觉与模式识别
2024-07-09 v1
摘要
我们提出一种新颖的图像合成方法,将多个输入图像整合到单个连贯图像中。不同于专注于特定场景(如外观编辑/图像调色和语义编辑/语义图像合成),我们展示了利用大规模预训练扩散模型所具备的强大生成先验,以实现适用于两者的通用图像合成的潜力。我们观察到,预训练扩散模型在去噪过程中会自动识别简单的复制粘贴边界区域作为低密度区域。基于此洞察,我们提出优化合成图像以适应高密度区域,同时受扩散先验指导。此外,我们引入一种新颖的掩码引导损失,以进一步实现灵活的语义图像合成。大量实验验证了我们方法在实现通用零样本图像合成方面的优越性。此外,我们的方法在诸多任务中展现出前景,例如对象移除和多概念定制。
引用
@article{arxiv.2407.04947,
title = {FreeCompose: Generic Zero-Shot Image Composition with Diffusion Prior},
author = {Zhekai Chen and Wen Wang and Zhen Yang and Zeqing Yuan and Hao Chen and Chunhua Shen},
journal= {arXiv preprint arXiv:2407.04947},
year = {2024}
}
备注
Accepted to Proc. Eur. Conf. Comp. Vision 2024. Project webpage: https://github.com/aim-uofa/FreeCompose