通过实例感知投影一致性学习动态场景中的单目深度
计算机视觉与模式识别
2021-02-05 v1 机器学习
机器人学
摘要
我们提出一个端到端联合训练框架,在无监督的单目相机设置中显式建模多个动态对象的6-DoF运动、自运动与深度。我们的技术贡献有三方面。首先,我们在建模每个刚体对象的独立运动时,强调了逆投影与前向投影的根本区别,并提出了使用神经前向投影模块的几何正确投影流程。其次,我们设计了一种统一的实例感知光度与几何一致性损失,对所有背景与对象区域整体施加自监督信号。最后,我们引入一种通用自动标注方案,使用任何现成的实例分割与光流模型生成视频实例分割图,作为我们训练流程的输入。这些提出的组件在详细的消融研究中得到验证。通过在KITTI与Cityscapes数据集上进行的广泛实验,我们的框架被证明优于最先进的深度与运动估计方法。我们的代码、数据集与模型可在https://github.com/SeokjuLee/Insta-DM获取。
引用
@article{arxiv.2102.02629,
title = {Learning Monocular Depth in Dynamic Scenes via Instance-Aware Projection Consistency},
author = {Seokju Lee and Sunghoon Im and Stephen Lin and In So Kweon},
journal= {arXiv preprint arXiv:2102.02629},
year = {2021}
}
备注
Accepted to AAAI 2021. Code/dataset/models are available at https://github.com/SeokjuLee/Insta-DM. arXiv admin note: substantial text overlap with arXiv:1912.09351