中文

基于分层中层级动作元素的动作识别

计算机视觉与模式识别 2015-09-01 v1

摘要

真实的人类动作视频在多个粒度级别上表现出丰富的时空结构:一个动作总是可以在空间和时间上被分解为多个更细粒度的元素。为了捕捉这一直觉,我们提出用中层级动作元素(MAEs)的层次结构来表示视频,其中每个 MAE 对应于视频中与动作相关的时空片段。我们引入了一种无监督方法从视频中生成这种表示。我们的方法能够区分与动作相关的片段和背景片段,并以多种时空分辨率表示动作。给定从训练数据生成的一组时空片段,我们引入了一种判别式聚类算法,可自动发现多个粒度级别的 MAEs。我们开发了结构化模型以捕捉片段之间丰富的空间、时间和层次关系,其中动作标签和多个级别的 MAE 标签被联合推断。所提出的模型在多个动作识别基准测试中取得了 SOTA 性能。此外,我们展示了我们的模型在现实应用中的有效性,例如大规模未剪辑视频中的动作识别和动作解析。

关键词

引用

@article{arxiv.1508.07654,
  title  = {Action Recognition by Hierarchical Mid-level Action Elements},
  author = {Tian Lan and Yuke Zhu and Amir Roshan Zamir and Silvio Savarese},
  journal= {arXiv preprint arXiv:1508.07654},
  year   = {2015}
}