中文

FusePose:运动学空间中用于参数化人体姿态估计的 IMU-视觉传感器融合

计算机视觉与模式识别 2022-08-26 v1

摘要

在 3D 人体姿态估计任务中存在诸多挑战性问题,例如由遮挡与自遮挡导致的性能不佳。近来,IMU-视觉传感器融合被视为解决这些问题的有效途径。然而,以往关于异构的 IMU 与视觉数据融合的研究,未能充分利用 IMU 原始数据或可靠的高层视觉特征。为促进更高效的传感器融合,本文在参数化人体运动学模型下提出名为 \emph{FusePose} 的框架。具体而言,我们聚合 IMU 或视觉数据的不同信息,并引入三种独特的传感器融合方法:NaiveFuse、KineFuse 与 AdaDeepFuse。NaiveFuse 作为一种基本方法,仅在欧氏空间中融合简化的 IMU 数据与估计的 3D 姿态。而在运动学空间中,KineFuse 能够将标定并对齐的 IMU 原始数据与转换后的 3D 姿态参数相整合。AdaDeepFuse 进一步将这一运动学融合过程发展为自适应且端到端可训练的方式。包含消融实验的综合性实验证明了所提框架的合理性与优越性。3D 人体姿态估计的性能相较基线结果有所提升。在 Total Capture 数据集上,KineFuse 以 8.6\% 的优势超越此前仅使用 IMU 进行测试的 state-of-the-art。AdaDeepFuse 以 8.5\% 的优势超越使用 IMU 进行训练与测试的 state-of-the-art。此外,我们通过在 Human3.6M 数据集上的实验验证了框架的泛化能力。

关键词

引用

@article{arxiv.2208.11960,
  title  = {FusePose: IMU-Vision Sensor Fusion in Kinematic Space for Parametric Human Pose Estimation},
  author = {Yiming Bao and Xu Zhao and Dahong Qian},
  journal= {arXiv preprint arXiv:2208.11960},
  year   = {2022}
}

备注

11 pages,8 figures