中文

基于事件 - 参与者交互的大规模视频事件动词自动标注

计算机视觉与模式识别 2012-04-17 v1 人工智能

摘要

我们提出了一种使用英语动词作为事件描述来标注短视频片段的方法。这项工作的一个关键区别在于,它使用描述事件参与者(即相互交互的人和物体)之间时空交互的动词来标注视频,抽象掉了所有物体类别信息和细粒度图像特征,仅依赖于事件参与者的粗粒度运动。我们将该方法应用于包含 22 个不同动词类别的大型数据集和包含 2,584 个视频语料库,得出了两个令人惊讶的结果。首先,在 22 选 1 的标注任务中分类准确率超过 70%,在该标注任务的多种 10 选 1 子集中准确率超过 85%,且这一结果与我们采用的两种时间序列分类器中的哪一种无关。其次,我们仅使用随时间变化的一个或两个事件参与者的边界框这一高度贫乏的中间表示就达到了此准确率水平。这表明成功的事件识别更取决于选择能够表征事件类语言不变量的适当特征,而非特定的分类器算法。

关键词

引用

@article{arxiv.1204.3616,
  title  = {Large-Scale Automatic Labeling of Video Events with Verbs Based on Event-Participant Interaction},
  author = {Andrei Barbu and Alexander Bridge and Dan Coroian and Sven Dickinson and Sam Mussman and Siddharth Narayanaswamy and Dhaval Salvi and Lara Schmidt and Jiangnan Shangguan and Jeffrey Mark Siskind and Jarrell Waggoner and Song Wang and Jinlian Wei and Yifan Yin and Zhiqi Zhang},
  journal= {arXiv preprint arXiv:1204.3616},
  year   = {2012}
}