利用姿态、运动与外观的链式多流网络用于动作分类与检测
计算机视觉与模式识别
2017-05-30 v2 人工智能
人机交互
多媒体
神经与进化计算
摘要
通用的人类动作识别需要理解各种视觉线索。在本文中,我们提出了一种网络架构,用于计算并整合动作识别中最重要的视觉线索:姿态、运动和原始图像。为了进行整合,我们引入了一个逐步添加线索的 Markov 链模型。所得方法高效,适用于动作分类以及空间和时间动作定位。这两项贡献明显提升了各自基线的性能。整体方法在 HMDB51、J-HMDB 和 NTU RGB+D 数据集上取得了 SOTA 的动作分类性能。此外,它在 UCF101 和 J-HMDB 上获得了 SOTA 的时空动作定位结果。
引用
@article{arxiv.1704.00616,
title = {Chained Multi-stream Networks Exploiting Pose, Motion, and Appearance for Action Classification and Detection},
author = {Mohammadreza Zolfaghari and Gabriel L. Oliveira and Nima Sedaghat and Thomas Brox},
journal= {arXiv preprint arXiv:1704.00616},
year = {2017}
}
备注
10 pages, 7 figures, ICCV 2017 submission