中文

用于三维人体姿态估计的基于深度网络的最大间隔结构化学习

计算机视觉与模式识别 2015-08-28 v1

摘要

本文关注使用深度神经网络从单目图像进行三维人体姿态估计的结构化输出学习。我们的网络以图像和三维姿态作为输入并输出一个分数值,当图像-姿态对匹配时该值较高,否则较低。网络结构由用于图像特征提取的卷积神经网络组成,随后是两个用于将图像特征和姿态转换到联合嵌入的子网络。分数函数即为图像和姿态嵌入之间的点积。使用最大间隔代价函数对图像-姿态嵌入和分数函数进行联合训练。我们提出的框架可以解释为一种特殊形式的结构化支持向量机,其中联合特征空间是使用深度神经网络判别性学习得到的。我们在 Human3.6m 数据集上测试了我们的框架,与其他近期方法相比获得了 SOTA 的结果。最后,我们展示了图像-姿态嵌入空间的可视化,证明网络已经学习了身体朝向和姿态配置的高级嵌入。

关键词

引用

@article{arxiv.1508.06708,
  title  = {Maximum-Margin Structured Learning with Deep Networks for 3D Human Pose Estimation},
  author = {Sijin Li and Weichen Zhang and Antoni B. Chan},
  journal= {arXiv preprint arXiv:1508.06708},
  year   = {2015}
}