中文

基于视频的无监督深度、光流与自运动联合学习

计算机视觉与模式识别 2021-06-01 v1

摘要

从图像中估计深度、相机运动和光流等几何要素是机器人视觉感知的重要组成部分。我们采用一种联合自监督方法来估计这三种几何要素。深度网络、光流网络和相机运动网络彼此独立,但在训练阶段进行联合优化。与独立训练相比,联合训练能够充分利用几何要素之间的几何关系,并提供场景的动态与静态信息。本文从网络结构、动态物体分割和几何约束三个方面改进了联合自监督方法。在网络结构方面,我们将注意力机制应用于相机运动网络,有助于利用帧间相机运动的相似性。并且根据 Transformer 中的注意力机制,我们提出了一种即插即用的卷积注意力模块。在动态物体方面,根据动态物体在光流自监督框架与深度-位姿自监督框架中影响的不同,我们提出了一种阈值算法来检测动态区域,并分别在损失函数中将其掩码。在几何约束方面,我们使用传统方法从对应点估计基础矩阵以约束相机运动网络。我们在 KITTI 数据集上验证了方法的有效性。与其他联合自监督方法相比,我们的方法在位姿和光流估计上达到了最先进的性能,深度估计也取得了具有竞争力的结果。代码将公开于 https://github.com/jianfenglihg/Unsupervised_geometry。

关键词

引用

@article{arxiv.2105.14520,
  title  = {Unsupervised Joint Learning of Depth, Optical Flow, Ego-motion from Video},
  author = {Jianfeng Li and Junqiao Zhao and Shuangfu Song and Tiantian Feng},
  journal= {arXiv preprint arXiv:2105.14520},
  year   = {2021}
}

备注

9 pages, 4 figures