中文

Thin-Slicing Network:一种用于视频中姿态估计的深度结构化模型

计算机视觉与模式识别 2017-04-03 v1

摘要

深度卷积网络已被证明在单张图像的人体姿态估计任务中是有效的。然而,在基于视频的场景中出现了一些具有挑战性的问题,例如自遮挡、运动模糊以及训练数据集中很少或没有示例的罕见姿态。时间信息可以提供关于身体关节位置的额外线索,并有助于缓解这些问题。在本文中,我们提出了一种深度结构化模型,用于在无约束视频中估计人体姿态序列。该模型可以以端到端的方式进行高效训练,并且能够同时表示身体关节的外观及其时空关系。关于人体的领域知识被显式地整合到网络中,提供了有效的先验以规范骨架结构并强制时间一致性。所提出的端到端架构在两个广泛使用的基于视频的姿态估计基准(Penn Action 数据集和 JHMDB 数据集)上进行了评估。我们的方法显著优于现有的最先进方法。

关键词

引用

@article{arxiv.1703.10898,
  title  = {Thin-Slicing Network: A Deep Structured Model for Pose Estimation in Videos},
  author = {Jie Song and Limin Wang and Luc Van Gool and Otmar Hilliges},
  journal= {arXiv preprint arXiv:1703.10898},
  year   = {2017}
}

备注

Preliminary version to appear in CVPR2017