D³epth:动态场景中带动态掩码的自监督深度估计
计算机视觉与模式识别
2024-11-08 v1 人工智能
机器学习
摘要
深度估计是机器人技术中的关键技术。最近,自监督深度估计方法展示了巨大的潜力,因为它们可以高效利用大量无标注的真实世界数据。然而,大多数现有方法都是在静态场景假设下设计的,这阻碍了它们在动态环境中的适应性。为了解决这个问题,我们提出了D³epth,一种用于动态场景中自监督深度估计的新方法。它从两个关键角度应对动态对象的挑战。首先,在自监督框架内,我们设计了一种重投影约束来识别可能包含动态对象的区域,允许构建动态掩码以在损失层面减轻其影响。其次,对于多帧深度估计,我们引入了一种代价体自动掩码策略,利用相邻帧来识别与动态对象相关的区域并生成相应的掩码。这为后续过程提供了指导。此外,我们提出了一种谱熵不确定性模块,将谱熵纳入深度融合过程中的不确定性估计,有效解决了动态环境中代价体计算带来的问题。在KITTI和Cityscapes数据集上的广泛实验表明,所提出的方法持续优于现有的自监督单目深度估计基线。代码可在\url{https://github.com/Csyunling/D3epth}获取。
引用
@article{arxiv.2411.04826,
title = {D$^3$epth: Self-Supervised Depth Estimation with Dynamic Mask in Dynamic Scenes},
author = {Siyu Chen and Hong Liu and Wenhao Li and Ying Zhu and Guoquan Wang and Jianbing Wu},
journal= {arXiv preprint arXiv:2411.04826},
year = {2024}
}
备注
Open sourced