面向自监督单目深度估计中动态区域的挖掘监督信号
计算机视觉与模式识别
2024-04-24 v1
摘要
本文聚焦于在动态场景下基于单目视频的自监督单目深度估计。现有方法同时估计像素级深度和运动,主要依赖图像重建损失。由于深度与运动估计固有的歧义,动态区域成为这些方法的关键挑战,导致深度估计不准确。本文提出一种利用训练数据中伪深度标签的自监督训练框架,以应对动态区域的挑战。框架的关键贡献在于在训练数据中解耦静态区域和动态区域的深度估计。我们首先采用无监督深度估计方法,为静态区域提供可靠的深度估计并为动态区域提供运动线索,从而允许我们在实例级别提取移动物体信息。在下一阶段,我们使用物体网络对这些移动物体的深度进行估计,假设其为刚性运动。然后,我们提出一种新的尺度对齐模块,以解决静态区域和动态区域估计深度之间的尺度歧义。我们随后使用生成的深度标签训练一个端到端的深度估计网络,从而提高其性能。在Cityscapes和KITTI数据集上的大量实验表明,我们的自训练策略持续地优于现有的自/无监督深度估计方法。
引用
@article{arxiv.2404.14908,
title = {Mining Supervision for Dynamic Regions in Self-Supervised Monocular Depth Estimation},
author = {Hoang Chuong Nguyen and Tianyu Wang and Jose M. Alvarez and Miaomiao Liu},
journal= {arXiv preprint arXiv:2404.14908},
year = {2024}
}
备注
Accepted to CVPR2024