中文

视频中的 3D 姿态检测:聚焦遮挡问题

计算机视觉与模式识别 2020-06-25 v1

摘要

本文中,我们基于现有的视频中遮挡感知 3D 姿态检测方法展开研究。我们实现了一个两阶段架构,由堆叠沙漏网络(stacked hourglass network)生成 2D 姿态预测,随后将其输入时序卷积网络(temporal convolutional network)以生成 3D 姿态预测。为促进对含遮挡关节姿态的预测,我们引入了对用于生成遮挡标签的圆柱人模型(cylinder man model)的一种直观推广。我们发现,在 Human3.6M 数据集上,遮挡感知网络相较我们的线性基线模型实现了平均逐关节位置误差减少 5 mm。与我们的时序卷积网络基线相比,我们以更低的计算成本取得了可比的平均逐关节位置误差,仅少 0.1 mm。

关键词

引用

@article{arxiv.2006.13517,
  title  = {3D Pose Detection in Videos: Focusing on Occlusion},
  author = {Justin Wang and Edward Xu and Kangrui Xue and Lukasz Kidzinski},
  journal= {arXiv preprint arXiv:2006.13517},
  year   = {2020}
}