中文

基于单目视频与稀疏IMU的混合三维人体姿态估计

计算机视觉与模式识别 2024-04-30 v1 人机交互

摘要

由于二维到三维提升中的深度模糊性,从单目视频进行时间序列三维人体姿态估计是面向人的计算机视觉中的一项挑战性任务。为了提高精度并解决遮挡问题,惯性传感器被引入以提供互补的信息源。然而,整合异构传感器数据以生成物理上合理的三维人体姿态仍然具有挑战性。在本文中,我们提出了一种新颖的框架——实时优化与融合(RTOF)来解决这一问题。我们首先将稀疏惯性方向融入参数化人体骨骼,以在运动学上优化三维姿态。然后,通过基于视觉和惯性观测构建的能量函数对姿态进行优化,以减少时间抖动。我们的框架输出平滑且生物力学上合理的人体运动。包含消融研究的综合实验证明了其合理性和效率。在Total Capture数据集上,与基线方法相比,姿态估计误差显著降低。

关键词

引用

@article{arxiv.2404.17837,
  title  = {Hybrid 3D Human Pose Estimation with Monocular Video and Sparse IMUs},
  author = {Yiming Bao and Xu Zhao and Dahong Qian},
  journal= {arXiv preprint arXiv:2404.17837},
  year   = {2024}
}

备注

10 pages, 5 figures, Under Review