中文

视频超体素分割中参与者与动作语义保留的研究

计算机视觉与模式识别 2013-11-15 v1

摘要

语义计算机视觉领域的现有方法似乎无法应对现代开源和社交视频内容的爆发式增长及其丰富性。尽管目标检测或词袋模型等复杂方法已得到充分研究,但它们通常作用于低级特征,最终受限于可扩展性问题或缺乏语义含义。另一方面,视频超体素分割最近已被建立并应用于大规模数据处理, potentially 作为高级视频语义提取的中间表示。超体素是对视频内容的丰富分解:它们能很好地捕捉物体形状和运动。然而,超体素分割是否保留了底层视频内容的语义尚不清楚。在本文中,我们系统研究了参与者(actor)和动作(action)语义在视频超体素分割中的保留程度。我们的研究让人类观察者观看超体素分割视频,并尝试区分参与者(人类或动物)和动作(八种日常动作之一)。我们收集并分析了来自 96 个视频、3 种不同超体素尺度的 640 组人类感知数据。此外,我们在定义于超体素分割的特征(称为超体素形状上下文)上进行了机器识别实验,该特征灵感来源于人类感知的高阶过程。我们的最终发现表明,大量语义在视频超体素分割中得到了很好的保留,可用于进一步的视频分析。

关键词

引用

@article{arxiv.1311.3318,
  title  = {A Study of Actor and Action Semantic Retention in Video Supervoxel Segmentation},
  author = {Chenliang Xu and Richard F. Doell and Stephen José Hanson and Catherine Hanson and Jason J. Corso},
  journal= {arXiv preprint arXiv:1311.3318},
  year   = {2013}
}

备注

This article is in review at the International Journal of Semantic Computing