用于单目视频中人类交互识别的深度卷积姿态
计算机视觉与模式识别
2016-12-14 v1
摘要
人类交互识别是计算机视觉中的一个挑战性问题,因其重要的应用价值多年来一直被研究。随着人体姿态估计问题深度模型的发展,本工作旨在验证使用人体姿态来识别单目视频中人类交互的有效性。本文开发了一种基于5个步骤的方法:检测场景中的每个人,跟踪他们,获取人体姿态,基于姿态提取特征,最后使用分类器识别交互。Two-Person交互数据集被用于开发该方法。使用整体序列评估方法,在所有交互中达到了87.56%的平均准确率。Yun等人使用同一数据集达到了91.10%,然而他们的方法使用了深度传感器来识别交互。本文开发的方法表明,利用近期发展的深度模型来估计人体姿态,RGB相机可以和深度相机一样有效地识别两人之间的交互。
引用
@article{arxiv.1612.03982,
title = {Deep Convolutional Poses for Human Interaction Recognition in Monocular Videos},
author = {Marcel Sheeny de Moraes and Sankha Mukherjee and Neil M Robertson},
journal= {arXiv preprint arXiv:1612.03982},
year = {2016}
}