中文

用于人类动作识别的潜在时空组合模型学习

计算机视觉与模式识别 2015-02-03 v1

摘要

动作识别是多媒体理解中的一个重要问题。本文通过构建一个具有表达力的组合动作模型来解决这一问题。我们将视频中的一个动作实例建模为时空组合的集合:若干个离散的时间锚帧,每个锚帧进一步分解为可变形部件的布局。通过这种方式,我们的模型能够识别时空与或图 (STAOG) 以表示动作的潜在结构,例如三级跳远、荡秋千和跳高。STAOG 模型包含四层:(i) 底部的叶节点批次,用于检测视频块内的各种动作部件;(ii) 底部之上的或节点,即开关变量,用于激活其子叶节点以实现结构可变性;(iii) 锚帧内的与节点,用于验证空间组合;(iv) 顶部的根节点,用于聚合时间锚帧上的得分。此外,在空间和时间域内的叶节点之间定义了上下文交互。对于模型训练,我们开发了一种新的弱监督学习算法,该算法迭代地确定结构配置(例如与或节点关联的叶节点的产生)以及多层参数的优化。通过充分利用时空组合和交互,我们的方法很好地处理了类内巨大的动作方差(例如不同视角、个体外观、时空结构)。在具有挑战性的数据库上的实验结果表明,我们的方法优于其他竞争方法。

关键词

引用

@article{arxiv.1502.00258,
  title  = {Learning Latent Spatio-Temporal Compositional Model for Human Action Recognition},
  author = {Xiaodan Liang and Liang Lin and Liangliang Cao},
  journal= {arXiv preprint arXiv:1502.00258},
  year   = {2015}
}

备注

This manuscript has 10 pages with 7 figures, and a preliminary version was published in ACM MM'13