中文

揭示深度:面向挑战场景的多模态融合框架

计算机视觉与模式识别 2024-02-20 v1

摘要

基于RGB图像的单目深度估计在3D视觉中起着关键作用。然而,在夜间或恶劣天气等挑战性环境中,其精度可能会下降。长波红外相机在此类挑战条件下能提供稳定的成像,但其固有分辨率低,缺乏RGB图像提供的丰富纹理和语义。由于难以识别和整合来自两种来源的可靠深度线索,当前方法仅专注于单一模态。为解决这些问题,本文提出了一种新颖方法,通过基于学习的框架识别并整合主导的跨模态深度特征。具体而言,我们利用每种模态各自的深度线索,通过独立网络分别计算粗略深度图。由于优势深度分布在两种模态中,我们提出一种新颖的置信度损失,引导置信度预测网络生成指定潜在深度区域的置信度图。利用生成的置信度图,我们提出一种多模态融合网络,以端到端方式融合最终深度。利用所提出的流程,我们的方法展示了在多种困难场景下进行鲁棒深度估计的能力。在具有挑战性的MS2^2和ViViD++数据集上的实验结果证明了我们方法的有效性和鲁棒性。

关键词

引用

@article{arxiv.2402.11826,
  title  = {Unveiling the Depths: A Multi-Modal Fusion Framework for Challenging Scenarios},
  author = {Jialei Xu and Xianming Liu and Junjun Jiang and Kui Jiang and Rui Li and Kai Cheng and Xiangyang Ji},
  journal= {arXiv preprint arXiv:2402.11826},
  year   = {2024}
}