中文

SemAttNet:基于注意力机制的语义感知引导深度补全

计算机视觉与模式识别 2026-04-16 v2

摘要

深度补全旨在从稀疏深度图和 RGB 图像中恢复稠密深度图。近期方法侧重于利用彩色图像作为引导图像来恢复无效像素处的深度。然而,仅凭彩色图像不足以提供对场景必要的语义理解。因此,深度补全任务受 RGB 图像中突变光照(如阴影)的影响。本文中,我们提出了一种新颖的三分支骨干网络,包含颜色引导、语义引导和深度引导分支。具体而言,颜色引导分支以稀疏深度图和 RGB 图像作为输入,生成包含场景颜色线索(如物体边界)的颜色深度。颜色引导分支预测的稠密深度图连同语义图像与稀疏深度图一起作为输入送入语义引导分支以估计语义深度。深度引导分支取稀疏深度、颜色深度和语义深度来生成稠密深度图。颜色深度、语义深度和引导深度被自适应融合以产生我们提出的三分支骨干网络的输出。此外,我们还提出应用语义感知多模态基于注意力的融合块(SAMMAFB)来融合三个分支之间的特征。我们进一步使用带空洞卷积的 CSPN++ 来细化三分支骨干网络产生的稠密深度图。大量实验表明,我们的模型在提交时的 KITTI 深度补全基准上达到了最先进的性能。

关键词

引用

@article{arxiv.2204.13635,
  title  = {SemAttNet: Towards Attention-based Semantic Aware Guided Depth Completion},
  author = {Danish Nazir and Marcus Liwicki and Didier Stricker and Muhammad Zeshan Afzal},
  journal= {arXiv preprint arXiv:2204.13635},
  year   = {2026}
}

备注

accepted at IEEE Access