用于人体动作识别的姿态条件时空注意力
计算机视觉与模式识别
2017-08-08 v2
摘要
我们处理来自包含关节姿态和RGB帧的多模态视频数据的人体动作识别,并提出一种双流方法。姿态流由一个卷积模型处理,该模型以保存子序列数据的3D张量作为输入。一种特定的关节排序尊重人体拓扑,确保不同的卷积层对应于有意义的抽象层次。原始RGB流由以姿态网络特征为条件的时空软注意力机制处理。一个LSTM网络在每个时刻从一组图像位置接收输入。一个可训练的瞥见传感器在由姿态流指定的预定义位置集合上提取特征,即所涉及活动中两个人的4只手。外观特征给出关于手部运动和每只手中持有物体重要线索。我们表明,根据活动本身在不同时间步将注意力转移到不同手部具有高度意义。最后,时间注意力机制学习如何随时间融合LSTM特征。我们在3个数据集上评估该方法。在最大的人体活动识别数据集即NTU-RGB+D以及SBU Kinect Interaction数据集上取得了最先进结果。在较小的MSR Daily Activity 3D数据集上取得了接近最先进性能。
引用
@article{arxiv.1703.10106,
title = {Pose-conditioned Spatio-Temporal Attention for Human Action Recognition},
author = {Fabien Baradel and Christian Wolf and Julien Mille},
journal= {arXiv preprint arXiv:1703.10106},
year = {2017}
}
备注
10 pages, project page: https://fabienbaradel.github.io/pose_rgb_attention_human_action