中文

从两帧图像学习分割刚体运动

计算机视觉与模式识别 2021-01-12 v1

摘要

基于外观的检测器在常见场景中取得了卓越性能,但在缺乏训练数据的场景下往往失效。而几何运动分割算法虽能泛化至新颖场景,但由于运动估计存在噪声以及运动构型退化,其性能尚不及基于外观的方法。为兼取两者之长,我们提出了一种模块化网络,其架构源于对从自运动场中可恢复哪些独立物体运动的几何分析。该网络以连续两帧为输入,预测背景与多个刚体运动物体的分割掩码,并用三维刚体变换对其参数化。我们的方法在 KITTI 和 Sintel 的刚体运动分割上达到了最先进性能。推断出的刚体运动显著改进了深度与场景流估计。在提交时,我们的方法在 KITTI 场景流排行榜上排名第 1,优于最佳已发表方法(场景流误差:4.89% 对 6.31%)。

关键词

引用

@article{arxiv.2101.03694,
  title  = {Learning to Segment Rigid Motions from Two Frames},
  author = {Gengshan Yang and Deva Ramanan},
  journal= {arXiv preprint arXiv:2101.03694},
  year   = {2021}
}

备注

code will be released at https://github.com/gengshan-y/rigidmask