面向层次化舞蹈视频识别的无监督三维姿态估计
计算机视觉与模式识别
2021-09-21 v1
摘要
舞蹈专家通常将舞蹈视为一种层次化信息,涵盖低层(原始图像、图像序列)、中层(人体姿态与身体部位运动)和高层(舞蹈类型)。我们提出了一种层次化舞蹈视频识别框架(HDVR)。HDVR估计二维姿态序列、跟踪舞者,然后同时估计相应的三维姿态与三维到二维成像参数,且不需要三维姿态的真值。与大多数针对单人的方法不同,我们的跟踪可在遮挡情况下处理多名舞者。根据估计得到的三维姿态序列,HDVR提取身体部位运动,并由此识别舞蹈类型。所得层次化舞蹈表示对专家而言是可解释的。为克服噪声与帧间对应歧义,我们施加了空间与时间运动平滑性以及随时间变化的亮度连续性。我们使用LSTM网络提取三维运动子序列,并据此识别舞蹈类型。在实验中,我们确定了16个身体部位的154种运动类型,并构建了一个新的伊利诺伊大学舞蹈(UID)数据集,包含9种类型共1143个视频片段、覆盖30小时,标注了运动与类型标签。实验结果表明,我们的算法优于当前最先进(SOTA)的三维姿态估计方法,这也提升了我们的舞蹈识别性能。
引用
@article{arxiv.2109.09166,
title = {Unsupervised 3D Pose Estimation for Hierarchical Dance Video Recognition},
author = {Xiaodan Hu and Narendra Ahuja},
journal= {arXiv preprint arXiv:2109.09166},
year = {2021}
}
备注
To appear in ICCV2021