中文

基于推理嵌入多任务学习的深度图像人体姿态估计

计算机视觉与模式识别 2016-08-16 v1

摘要

人体姿态估计(即定位人体的身体部位/关节)是人机交互和多媒体应用中的一个基本问题。基于深度传感器的发展,已取得了显著进展,即从静态深度图像中进行可访问的人体姿态预测[32]。然而,大多数现有方法涉及多个独立设计和优化的组件/模型,导致次优性能。在本文中,我们提出了一种新颖的推理嵌入多任务学习框架,用于从静态深度图像预测人体姿态,该框架通过深度神经网络架构实现。具体而言,我们处理两个级联任务:i) 通过全卷积网络 (FCN) 生成身体部位的热力(置信度)图;ii) 基于检测到的身体部位提议,通过内置推理的 MatchNet [10] 寻求身体部位的最优配置,该方法衡量身体部位的外观和几何运动学兼容性,并将动态规划推理体现为额外的网络层。这两个任务被联合优化。我们的大量实验表明,所提出的深度模型在人体姿态估计的准确性上显著优于其他几种最先进的方法或 SDK。我们还发布了一个大规模数据集用于比较,该数据集包含 100K 张具有挑战性场景下的深度图像。

关键词

引用

@article{arxiv.1608.03932,
  title  = {Human Pose Estimation from Depth Images via Inference Embedded Multi-task Learning},
  author = {Keze Wang and Shengfu Zhai and Hui Cheng and Xiaodan Liang and Liang Lin},
  journal= {arXiv preprint arXiv:1608.03932},
  year   = {2016}
}

备注

To appear in ACM Multimedia 2016, full paper (oral), 10 pages, 11 figures