中文

RAFT-3D:基于刚体运动嵌入的场景流估计

计算机视觉与模式识别 2021-04-07 v2

摘要

我们解决场景流问题:给定立体或 RGB-D 视频帧对,估计逐像素 3D 运动。我们引入 RAFT-3D,一种用于场景流的新深度架构。RAFT-3D 基于为光流开发的 RAFT 模型,但迭代更新逐像素 SE3 运动的密集场而非 2D 运动。RAFT-3D 的一项关键创新是刚体运动嵌入,其表示像素向刚体对象的软分组。刚体运动嵌入的核心是可微层 Dense-SE3,其强制嵌入的几何一致性。实验表明 RAFT-3D 达到最先进性能。在 FlyingThings3D 上,于双视图评估下,我们将已发表最佳精度(d < 0.05)从 34.3% 提升至 83.7%。在 KITTI 上,我们实现 5.77 的误差,优于已发表最佳方法(6.31),尽管未使用任何对象实例监督。代码见 https://github.com/princeton-vl/RAFT-3D。

关键词

引用

@article{arxiv.2012.00726,
  title  = {RAFT-3D: Scene Flow using Rigid-Motion Embeddings},
  author = {Zachary Teed and Jia Deng},
  journal= {arXiv preprint arXiv:2012.00726},
  year   = {2021}
}