中文

大型视频数据集中离散状态的半自动标注

计算机视觉与模式识别 2016-12-06 v1

摘要

我们提出了一个用于视频帧半自动标注的框架,其中视频中的对象在任何时刻都可以被标记为处于有限数量的离散状态之一。使用隐马尔可夫模型对以下两点进行建模:(1) 底层对象的行为,以及 (2) 通过图像处理算法对其状态的含噪观测。该方法的关键洞察在于,逐帧视频标注可以从对每张单张图像进行标注的问题,简化为检测视频中所记录底层对象状态之间转换的问题。该框架的性能在一个驾驶员视线分类数据集上进行了评估,该数据集包含 16,000,000 张图像,耗费了 6,000 小时的直接人工标注劳动完成了完全标注。在该数据集上,我们在 99.1% 的平均准确率下实现了 13 倍的人工标注缩减,在 91.2% 的平均准确率下实现了 84 倍的缩减。

关键词

引用

@article{arxiv.1612.01035,
  title  = {Semi-Automated Annotation of Discrete States in Large Video Datasets},
  author = {Lex Fridman and Bryan Reimer},
  journal= {arXiv preprint arXiv:1612.01035},
  year   = {2016}
}

备注

To be presented at AAAI 2017. arXiv admin note: text overlap with arXiv:1508.04028