USegScene:基于语义引导与耦合网络的无监督深度、光流及自运动学习
计算机视觉与模式识别
2022-07-18 v1 机器人学
摘要
在本文中,我们提出 USegScene,一种利用卷积神经网络对立体相机图像进行语义引导的无监督深度、光流与自运动估计学习的框架。我们的框架利用语义信息改进深度与光流图的正则化、多模态融合与遮挡填充,将动态刚体运动视为独立的 SE(3) 变换。此外,作为纯光度匹配的补充,我们提出在连续图像间匹配语义特征、像素级类别与物体实例边界。与先前方法不同,我们提出一种联合预测所有输出并使用共享编码器的网络架构,并允许跨任务域传递信息,例如光流预测可受益于深度预测。此外,我们在网络内部显式学习深度与光流遮挡图,并将其用于改进相应区域的预测。我们在流行的 KITTI 数据集上展示结果,表明我们的方法大幅优于其他方法。
引用
@article{arxiv.2207.07469,
title = {USegScene: Unsupervised Learning of Depth, Optical Flow and Ego-Motion with Semantic Guidance and Coupled Networks},
author = {Johan Vertens and Wolfram Burgard},
journal= {arXiv preprint arXiv:2207.07469},
year = {2022}
}