时间机会主义者:自监督多帧单目深度估计
计算机视觉与模式识别
2021-07-15 v2
摘要
自监督单目深度估计网络在训练时被训练为利用邻近帧作为监督信号预测场景深度。然而,对于许多应用,以视频帧形式存在的序列信息在测试时同样可用。绝大多数单目网络未利用这一额外信号,从而忽略了可用于改进预测深度的宝贵信息。那些利用的网络,要么使用计算昂贵的测试时精炼技术,要么使用现成的循环网络,其仅间接利用固有可用的几何信息。我们提出 ManyDepth,一种自适应稠密深度估计方法,可在测试时利用序列信息(当可用时)。受多视图立体启发,我们提出一种仅使用自监督训练的基于深度端到端代价体的方法。我们提出一种新颖一致性损失,鼓励网络在代价体不可靠(例如运动物体情况)时忽略之,以及一种应对静态相机的增强方案。我们在 KITTI 与 Cityscapes 上的详尽实验表明,我们优于所有已发布的自监督基线,包括测试时使用单帧或多帧的基线。
引用
@article{arxiv.2104.14540,
title = {The Temporal Opportunist: Self-Supervised Multi-Frame Monocular Depth},
author = {Jamie Watson and Oisin Mac Aodha and Victor Prisacariu and Gabriel Brostow and Michael Firman},
journal= {arXiv preprint arXiv:2104.14540},
year = {2021}
}
备注
CVPR 2021