中文

利用深度图与注意力机制增强图像修复

图像与视频处理 2025-05-09 v2 计算机视觉与模式识别

摘要

现有的基于深度学习的图像修复方法通常依赖卷积网络与 RGB 图像来重建图像。然而,仅依赖 RGB 图像可能会忽略重要的深度信息,而深度信息对于理解场景的空间和结构上下文起着关键作用。正如人类视觉利用立体线索来感知深度一样,将深度图纳入修复过程可以增强模型以更高精度和上下文感知能力重建图像的能力。本文提出了一种结合 RGB 图像和深度图像以增强图像修复的新方法。我们的模型采用双编码器架构,其中一个编码器处理 RGB 图像,另一个处理深度图像。随后,来自两个编码器的编码特征在解码器中通过注意力机制进行融合,有效整合了 RGB 和深度表示。我们使用线条和方块两种不同的掩码策略,以测试模型在不同类型遮挡下的鲁棒性。为进一步分析我们方法的有效性,我们使用梯度加权类激活映射(Grad-CAM)可视化来检查模型在修复过程中关注的感兴趣区域。我们表明,将深度信息与 RGB 图像结合能显著提升重建质量。通过定性和定量比较,我们证明深度集成模型优于基线模型,且注意力机制进一步增强了修复性能,多项评估指标和可视化结果均证实了这一点。

关键词

引用

@article{arxiv.2505.00735,
  title  = {Leveraging Depth Maps and Attention Mechanisms for Enhanced Image Inpainting},
  author = {Jin Hyun Park and Harine Choi and Praewa Pitiphat},
  journal= {arXiv preprint arXiv:2505.00735},
  year   = {2025}
}