中文

基于潜在空间优化的语义一致性和多模态图像填充

计算机视觉与模式识别 2026-02-25 v2

摘要

随着去噪扩散概率模型(DDPMs)的发展,图像填充技术已从仅基于相邻区域填充信息的简单方法,发展为能够条件化各种提示(如文本、示例图像和草图)来生成内容。然而,现有方法(如模型微调和潜在向量的简单拼接)常因过拟合和填充区域与背景不一致而导致生成失败。本文认为当前大的扩散模型已经足够强大,可无需进一步调参即可生成逼真的图像。因此,我们引入了 PILOT(Painting via Latent Optimization,即通过潜在空间优化进行图像填充),这是一种基于新颖的语义中心化和背景保持损失的优化方法。我们的 method 通过搜索能够生成既符合用户提供提示又与背景保持一致的填充区域的潜在空间。此外,我们提出了一种平衡优化成本与图像质量的策略,显著提高了生成效率。该方法无缝集成到任何预训练模型中,包括 ControlNet 和 DreamBooth,适用于部署在多模态编辑工具中。我们的定性和定量评估表明,PILOT 在生成响应提供提示的更连贯、更具多样性和更忠实的填充区域方面优于现有方法。

关键词

引用

@article{arxiv.2407.08019,
  title  = {Coherent and Multi-modality Image Inpainting via Latent Space Optimization},
  author = {Lingzhi Pan and Tong Zhang and Bingyuan Chen and Qi Zhou and Wei Ke and Sabine Süsstrunk and Mathieu Salzmann},
  journal= {arXiv preprint arXiv:2407.08019},
  year   = {2026}
}