中文

从视频中获取几何上下文

计算机视觉与模式识别 2016-11-17 v1

摘要

我们提出了一种新颖的算法,用于估计室外视频场景的宏观 3D 几何结构。利用时空视频分割,我们基于在外观和运动特征上训练的区域分类器所做的预测,将视频捕获的动态场景分解为多个几何类别。通过检查预测的同质性,我们结合了多个分割层级上的预测,从而无需先验确定粒度。我们构建了一个新颖且广泛的视频几何上下文数据集来评估我们的方法,该数据集包含超过 100 个带有真值标注的室外视频,帧数超过 20,000 帧。为了进一步扩展超越该数据集的规模,我们提出了一种半监督学习框架,利用从无标注数据中获得的高置信度预测来扩充带标注数据池。我们的系统对视频几何上下文产生了准确的预测,在主要几何类别上达到了 96% 的准确率。

关键词

引用

@article{arxiv.1510.07320,
  title  = {Geometric Context from Videos},
  author = {S. Hussain Raza and Matthias Grundmann and Irfan Essa},
  journal= {arXiv preprint arXiv:1510.07320},
  year   = {2016}
}

备注

Computer Vision and Pattern Recognition (CVPR), 2013 IEEE Conference on