基于分层中层级动作元素的动作识别
计算机视觉与模式识别
2015-09-01 v1
摘要
真实的人类动作视频在多个粒度级别上表现出丰富的时空结构:一个动作总是可以在空间和时间上被分解为多个更细粒度的元素。为了捕捉这一直觉,我们提出用中层级动作元素(MAEs)的层次结构来表示视频,其中每个 MAE 对应于视频中与动作相关的时空片段。我们引入了一种无监督方法从视频中生成这种表示。我们的方法能够区分与动作相关的片段和背景片段,并以多种时空分辨率表示动作。给定从训练数据生成的一组时空片段,我们引入了一种判别式聚类算法,可自动发现多个粒度级别的 MAEs。我们开发了结构化模型以捕捉片段之间丰富的空间、时间和层次关系,其中动作标签和多个级别的 MAE 标签被联合推断。所提出的模型在多个动作识别基准测试中取得了 SOTA 性能。此外,我们展示了我们的模型在现实应用中的有效性,例如大规模未剪辑视频中的动作识别和动作解析。
引用
@article{arxiv.1508.07654,
title = {Action Recognition by Hierarchical Mid-level Action Elements},
author = {Tian Lan and Yuke Zhu and Amir Roshan Zamir and Silvio Savarese},
journal= {arXiv preprint arXiv:1508.07654},
year = {2015}
}