RM-Depth:动态场景中单目深度的无监督循环学习
计算机视觉与模式识别
2023-03-09 v1
摘要
无监督方法在单目深度估计上已展现出有前景的结果。然而,训练数据必须在无运动物体的场景中采集。为突破精度上限,近期方法倾向于增加其模型参数。本文提出一种无监督学习框架,联合预测单目深度并补全包含运动物体运动与相机运动的完整3D运动。(1) 使用循环调制单元自适应且迭代地融合编码器与解码器特征。这不仅改进了单图像深度推断,且不会过度耗费模型参数。(2) 不同于使用单一组滤波器进行上采样,设计了多组滤波器用于残差上采样。这促进了保边滤波器的学习并带来性能提升。(3) 使用基于变形的网络估计运动物体的运动场而无需语义先验。这打破了场景刚性的要求,并允许使用通用视频进行无监督学习。该运动场进一步由离群感知训练损失正则化。尽管深度模型在测试时仅使用单张图像且参数为2.97M,其在KITTI和Cityscapes基准上取得了SOTA结果。
引用
@article{arxiv.2303.04456,
title = {RM-Depth: Unsupervised Learning of Recurrent Monocular Depth in Dynamic Scenes},
author = {Tak-Wai Hui},
journal= {arXiv preprint arXiv:2303.04456},
year = {2023}
}
备注
Accepted to CVPR 2022 (paper is updated)