中文

以自我为中心的高度估计

计算机视觉与模式识别 2016-10-11 v1

摘要

以自我为中心的(或称第一人称)视觉近年来随着可穿戴技术的兴起而变得流行,它与以外部为中心的(第三人称)视觉在某些可区分的方面有所不同,其中之一是相机佩戴者通常在视频帧中不可见。最近已有关于以自我为中心视频中的动作和物体识别的工作,以及从第一人称视频中提取生物特征的工作。高度估计对于软生物特征识别和物体跟踪都是一个有用的特征。在此,我们提出一种在没有任何校准或参考点的情况下估计以自我为中心的相机高度的方法。我们同时使用了传统的计算机视觉方法和深度学习,以确定能产生最佳高度估计的视觉线索。我们引入了一个受双流网络启发的框架,该框架由两个卷积神经网络组成,一个基于空间信息,另一个基于帧中光流给出的信息。给定一个以自我为中心的视频作为框架的输入,我们的模型输出一个高度估计值。我们还结合了后期融合来学习时空线索的组合。将我们的模型与我们用作基线的其他方法进行比较,我们在103厘米的数据范围内实现了视频高度估计的平均绝对误差为14.04厘米,相对高度(高、中或矮)的分类准确率高达93.75%,而随机猜测水平为33%。

关键词

引用

@article{arxiv.1610.02714,
  title  = {Egocentric Height Estimation},
  author = {Jessica Finocchiaro and Aisha Urooj Khan and Ali Borji},
  journal= {arXiv preprint arXiv:1610.02714},
  year   = {2016}
}