用于高分辨率图像修复的聚合上下文变换方法
计算机视觉与模式识别
2024-10-28 v1
摘要
最先进的图像修复方法在修复高分辨率图像(如 512x512)时,可能产生扭曲的结构与模糊的纹理。其挑战主要源于:(1)从远距离上下文进行图像内容推理;(2)对大缺失区域进行细粒度纹理合成。为克服这两大挑战,我们提出了一种增强的基于 GAN 的模型,称为聚合上下文变换 GAN(AOT-GAN),用于高分辨率图像修复。具体而言,为增强上下文推理,我们通过堆叠多层所提出的 AOT 块来构建 AOT-GAN 的生成器。AOT 块聚合来自不同感受野的上下文变换,从而能够捕获信息丰富的远距离图像上下文与感兴趣的模式以进行上下文推理。为改进纹理合成,我们通过以定制的掩码预测任务训练 AOT-GAN 的判别器来对其增强。该训练目标迫使判别器区分真实与合成图像块的细致外观,进而促使生成器合成清晰的纹理。在 Places2(含 365 种复杂场景的 180 万张高分辨率图像、最具挑战性的基准)上的大量对比表明,我们的模型在 FID 上以 38.60% 的相对提升显著优于当前最优方法。包含 30 余名受试者的用户研究进一步验证了 AOT-GAN 的优越性。我们进一步在实际应用(如 logo 去除、人脸编辑与物体移除)中评估所提出的 AOT-GAN,结果显示我们的模型在真实世界中取得了令人满意的补全效果。我们在 https://github.com/researchmm/AOT-GAN-for-Inpainting 发布了代码与模型。
引用
@article{arxiv.2104.01431,
title = {Aggregated Contextual Transformations for High-Resolution Image Inpainting},
author = {Yanhong Zeng and Jianlong Fu and Hongyang Chao and Baining Guo},
journal= {arXiv preprint arXiv:2104.01431},
year = {2024}
}
备注
This work has been submitted to the IEEE for possible publication