中文

SfM-Net:从视频中学习结构与运动

计算机视觉与模式识别 2017-04-26 v1

摘要

我们提出SfM-Net,一种用于视频运动估计的几何感知神经网络,它根据场景和物体深度、相机运动以及3D物体旋转和平移来分解帧间像素运动。给定帧序列,SfM-Net预测深度、分割、相机和刚体物体运动,将它们转换为密集的帧间运动场(光流),可微分地随时间扭曲帧以匹配像素并反向传播。该模型可以用不同程度的监督进行训练:1)通过重投影光度误差自监督(完全无监督),2)通过自运动(相机运动)监督,或3)通过深度监督(例如由RGBD传感器提供)。SfM-Net提取有意义的深度估计,并成功估计帧间相机旋转和平移。它经常成功分割场景中的运动物体,即使从未提供此类监督。

关键词

引用

@article{arxiv.1704.07804,
  title  = {SfM-Net: Learning of Structure and Motion from Video},
  author = {Sudheendra Vijayanarasimhan and Susanna Ricco and Cordelia Schmid and Rahul Sukthankar and Katerina Fragkiadaki},
  journal= {arXiv preprint arXiv:1704.07804},
  year   = {2017}
}