中文

基于多模态引导的高保真图像填充 GAN 反演

计算机视觉与模式识别 2025-04-18 v1

摘要

生成对抗网络(GAN)反演在图像填充方面表现优异,后者旨在使用其未遮蔽内容恢复丢失或损坏的图像纹理。以往的 GAN 反演方法通常将经过训练的 GAN 模型作为有效的先验来生成缺失孔洞的真实区域。尽管表现优异,但它们忽略了一个硬约束:输入和输出中未遮蔽区域应相同,导致 GAN 反演与图像填充之间存在差距,从而影响性能。此外,现有的 GAN 反演方法通常只考虑单一模态的输入图像,忽略图像中其他辅助线索。为解决这些问题,我们提出了一种新型的 GAN 反演方法,称为 MMInvertFill,用于图像填充。MMInvertFill 主要包括多模态引导编码器和带 F&W+ 潜在空间的 GAN 生成器。具体而言,多模态编码器通过带门控掩码注意力模块利用额外的语义分割边缘纹理模态性质来增强多尺度结构。随后,引入预调制将这些结构编码为风格向量。为缓解明显的颜色差异和语义不一致问题,我们引入 F&W+ 潜在空间来桥接 GAN 反演与图像填充之间的差距。此外,为重建忠实且照片般的图像,我们设计了一个简单而有效的 Soft-update Mean Latent 模块,以捕获更多样化的同域模式,用于生成大量损坏的高保真纹理。在对六个具有挑战性的数据集进行大量实验中,我们表明该方法在定性和定量上均优于其他最先进的方法,并且能够有效支持超域图像的填充。

关键词

引用

@article{arxiv.2504.12844,
  title  = {High-Fidelity Image Inpainting with Multimodal Guided GAN Inversion},
  author = {Libo Zhang and Yongsheng Yu and Jiali Yao and Heng Fan},
  journal= {arXiv preprint arXiv:2504.12844},
  year   = {2025}
}

备注

Accepted to IJCV. arXiv admin note: text overlap with arXiv:2208.11850