我能走多远?:一种用于确定性视频深度预测的自监督方法
计算机视觉与模式识别
2022-07-12 v2 计算几何
摘要
本文提出了一种新颖的自监督方法,用于预测未来未观测到的真实世界城市场景的深度估计。本工作是首个探索自监督学习以估计视频中未来未观测帧的单目深度的研究。现有方法依赖大量标注样本来生成未见帧深度的概率性预测。然而,由于需要大量视频深度标注样本,这使其不切实际。此外,该情况的概率性质(一个过去可对应多个未来结果)常导致不正确的深度估计。与以往方法不同,我们将未观测帧的深度估计建模为视图合成问题,将未见视频帧的深度估计视为辅助任务,同时利用学习到的位姿合成回视图。该方法不仅成本低——训练时不使用任何真实深度(因此实用),而且是确定性的(一系列过去帧映射到紧邻的未来)。为应对此任务,我们首先开发了一种新颖的深度预测网络 DeFNet,通过预测潜在特征来估计未观测未来的深度。其次,我们开发了一种基于通道注意力的位姿估计网络,用于估计未观测帧的位姿。利用该学习到的位姿,估计的深度图被重建回图像域,从而形成自监督解决方案。我们提出的方法在 KITTI 和 Cityscapes 基准上的短期和中期预测设置中,相比最先进的替代方法在 Abs Rel 指标上显示出显著改进。代码见 https://github.com/sauradip/depthForecasting
引用
@article{arxiv.2207.00506,
title = {How Far Can I Go ? : A Self-Supervised Approach for Deterministic Video Depth Forecasting},
author = {Sauradip Nag and Nisarg Shah and Anran Qi and Raghavendra Ramachandra},
journal= {arXiv preprint arXiv:2207.00506},
year = {2022}
}
备注
Accepted in ML4AD Workshop, NeurIPS 2021