中文

SRFNet:通过面向空间可靠性的帧与事件融合实现细粒度结构的单目深度估计

计算机视觉与模式识别 2024-07-25 v2

摘要

单目深度估计是测量相对于相机距离的关键任务,对于机器人导航和自动驾驶等应用十分重要。传统的基于帧的方法由于有限的动态范围与运动模糊而存在性能下降问题。因此,近期工作利用新型事件相机,通过帧-事件特征融合来补充或引导帧模态。然而,事件流表现出空间稀疏性,使部分区域(尤其是光照变化微弱的区域)未被感知。因此,直接融合方法(如 RAMNet)常常忽略各模态中最可信区域的贡献。这导致模态融合过程中的结构歧义,从而降低了深度估计性能。本文提出一种新颖的面向空间可靠性的融合网络(SRFNet),能够在白天与夜间均以细粒度结构估计深度。我们的方法包含两个关键技术组件。首先,我们提出基于注意力的交互融合(AIF)模块,该模块将事件与帧的空间先验作为初始掩码,并学习共识区域以引导跨模态特征融合。融合后的特征随后被反馈以增强帧与事件特征学习。同时,它利用输出头生成融合掩码,该掩码被迭代更新以学习共识空间先验。其次,我们提出面向可靠性的深度细化(RDR)模块,基于融合特征与掩码以细粒度结构估计稠密深度。我们在合成与真实世界数据集上评估了方法的有效性,结果表明即使未经预训练,我们的方法也优于先前方法(如 RAMNet),尤其在夜间场景中。项目主页:https://vlislab22.github.io/SRFNet。

关键词

引用

@article{arxiv.2309.12842,
  title  = {SRFNet: Monocular Depth Estimation with Fine-grained Structure via Spatial Reliability-oriented Fusion of Frames and Events},
  author = {Tianbo Pan and Zidong Cao and Lin Wang},
  journal= {arXiv preprint arXiv:2309.12842},
  year   = {2024}
}

备注

Accepted to ICRA 2024