EffiScene:用于光流、深度、相机位姿与运动分割无监督联合学习的高效逐像素刚性推断
计算机视觉与模式识别
2021-05-18 v3
摘要
本文通过联合学习四个低级视觉子任务来解决具有挑战性的无监督场景流估计问题:光流 F、立体深度 D、相机位姿 P 与运动分割 S。我们的核心见解是,场景的刚性与物体运动及场景深度具有相同的内在几何结构。因此,来自 S 的刚性可通过联合耦合 F、D 和 P 来推断,以实现更鲁棒的估计。为此,我们提出了一种名为 EffiScene 的新型场景流框架,具有高效的联合刚性学习,超越了现有的带有独立辅助结构的流水线。在 EffiScene 中,我们首先在粗粒度上估计光流与深度,然后通过 Perspective-n-Points 方法计算相机位姿。为联合学习局部刚性,我们设计了一种新颖的从运动推断刚性(RfM)层,包含三个主要部分:(i)相关性提取;(ii)边界学习;(iii)离群点排除。最终输出基于来自 RfM 的刚性图 M_R 在更细层级上融合。为高效训练 EffiScene,设计了两种新损失 L_bnd 与 L_unc 以防止平凡解并正则化光流边界不连续性。在场景流基准 KITTI 上的大量实验表明,我们的方法有效且显著改进了所有子任务的最先进方法,即光流(5.19 → 4.20)、深度估计(3.78 → 3.46)、视觉里程计(0.012 → 0.011)与运动分割(0.57 → 0.62)。
引用
@article{arxiv.2011.08332,
title = {EffiScene: Efficient Per-Pixel Rigidity Inference for Unsupervised Joint Learning of Optical Flow, Depth, Camera Pose and Motion Segmentation},
author = {Yang Jiao and Trac D. Tran and Guangming Shi},
journal= {arXiv preprint arXiv:2011.08332},
year = {2021}
}
备注
Accpeted by IEEE Conf. on Computer Vision and Pattern Recognition (CVPR) 2021; v1 - original submit v2 - camera ready version v3 - correct small bugs in Equation(2)