中文

用于深度视频3D人体姿态估计的轨迹空间分解

计算机视觉与模式识别 2019-08-23 v1

摘要

现有的基于深度学习的视频3D人体姿态估计方法要么基于循环神经网络(RNN),要么基于卷积神经网络(CNN)。然而,基于RNN的框架只能处理帧数有限的序列,因为序列模型对坏帧敏感,并且在长序列上容易产生漂移。尽管现有的基于CNN的时序框架试图通过同时处理序列中的所有输入帧来解决敏感性和漂移问题,但当前最先进的基于CNN的框架仅限于从序列输入中估计单帧的3D姿态。在本文中,我们提出了一种利用矩阵分解进行序列3D人体姿态估计的深度学习框架。我们的方法同时处理所有输入帧以避免敏感性和漂移问题,同时输出输入序列中每一帧的3D姿态估计。具体来说,所有帧中的3D姿态被表示为一个运动矩阵,该矩阵被分解为轨迹基矩阵和轨迹系数矩阵。轨迹基矩阵通过矩阵分解方法(如奇异值分解(SVD)或离散余弦变换(DCT))预先计算,序列3D姿态估计的问题则被简化为训练一个深度网络来回归轨迹系数矩阵。我们通过在多个基准数据集上取得最先进的性能,证明了我们的框架在长序列上的有效性。源代码可在以下链接获取:https://github.com/jiahaoLjh/trajectory-pose-3d。

关键词

引用

@article{arxiv.1908.08289,
  title  = {Trajectory Space Factorization for Deep Video-Based 3D Human Pose Estimation},
  author = {Jiahao Lin and Gim Hee Lee},
  journal= {arXiv preprint arXiv:1908.08289},
  year   = {2019}
}

备注

13 pages, 5 figures. Accepted in BMVC 2019