从两帧图像学习分割刚体运动
计算机视觉与模式识别
2021-01-12 v1
摘要
基于外观的检测器在常见场景中取得了卓越性能,但在缺乏训练数据的场景下往往失效。而几何运动分割算法虽能泛化至新颖场景,但由于运动估计存在噪声以及运动构型退化,其性能尚不及基于外观的方法。为兼取两者之长,我们提出了一种模块化网络,其架构源于对从自运动场中可恢复哪些独立物体运动的几何分析。该网络以连续两帧为输入,预测背景与多个刚体运动物体的分割掩码,并用三维刚体变换对其参数化。我们的方法在 KITTI 和 Sintel 的刚体运动分割上达到了最先进性能。推断出的刚体运动显著改进了深度与场景流估计。在提交时,我们的方法在 KITTI 场景流排行榜上排名第 1,优于最佳已发表方法(场景流误差:4.89% 对 6.31%)。
引用
@article{arxiv.2101.03694,
title = {Learning to Segment Rigid Motions from Two Frames},
author = {Gengshan Yang and Deva Ramanan},
journal= {arXiv preprint arXiv:2101.03694},
year = {2021}
}
备注
code will be released at https://github.com/gengshan-y/rigidmask