大型遮挡图像 inpainting 的 Context-Semantic Fusion Network
计算机视觉与模式识别
2025-11-12 v1
摘要
本文提出一种语义引导框架,以解决大范围遮挡图像 inpainting 的难题,即关键视觉内容缺失且上下文线索有限。为弥补上下文不足, 我们利用预训练的 Amodal Completion(AC)模型生成结构感知的候选解,作为缺失区域的语义先验。 我们引入 Context-Semantic Fusion Network(CSF-Net),这是一种基于 transformer 的融合框架,用于将这些候选解与上下文特征融合,以生成用于图像 inpainting 的语义引导图像。 该引导显著改善了 inpainting质量,通过促进结构精确性和语义一致性。 CSF-Net 可无缝集成到现有 inpainting 模型中,而无需 architectural 修改, 在 diverse masking conditions 下均能一致提升性能。 在 Places365 和 COCOA 数据集上进行大规模实验表明,CSF-Net 有效减少了对象幻觉现象,同时提升了视觉真实性与语义对齐性。 CSF-Net的代码已公开于 https://github.com/chaeyeonheo/CSF-Net。
引用
@article{arxiv.2511.07987,
title = {CSF-Net: Context-Semantic Fusion Network for Large Mask Inpainting},
author = {Chae-Yeon Heo and Yeong-Jun Cho},
journal= {arXiv preprint arXiv:2511.07987},
year = {2025}
}
备注
8 pages, 5 figures, Accepted to WACV 2026 (to appear)