中文

基于双网络的自单目视频三维多人姿态估计

计算机视觉与模式识别 2022-05-09 v3

摘要

单目三维人体姿态估计近年来取得进展。多数方法聚焦于单人,在以人为中心的坐标系(即基于目标人体中心的坐标系)中估计姿态。因此,这些方法不适用于需要绝对坐标(如相机坐标)的多人三维姿态估计。此外,由于人际遮挡与密切人机交互,多人姿态估计比单姿态估计更具挑战性。现有的自顶向下多人方法依赖人体检测(即自顶向下方法),因而受检测误差影响,无法在多人群体场景中给出可靠姿态估计。同时,现有不使用人体检测的自底向上方法虽不受检测误差影响,但由于其一次性处理场景中所有人体,易出错,尤其对小尺度人物。为应对上述所有挑战,我们提出融合自顶向下与自底向上方法以发挥二者优势。我们的自顶向下网络估计图像块中所有人的关节而非一人,使其对可能的错误边界框具有鲁棒性。我们的自底向上网络引入基于人体检测的归一化热图,使网络更鲁棒地处理尺度变化。最后,将自顶向下与自底向上网络估计的三维姿态送入我们的融合网络得到最终三维姿态。为解决训练与测试数据间的常见鸿沟,我们在测试时进行优化,利用高阶时间约束、重投影损失与骨长正则化精炼估计的三维人体姿态。我们的评估证明了所提方法的有效性。代码与模型可用:https://github.com/3dpose/3D-Multi-Person-Pose。

关键词

引用

@article{arxiv.2205.00748,
  title  = {Dual networks based 3D Multi-Person Pose Estimation from Monocular Video},
  author = {Yu Cheng and Bo Wang and Robby T. Tan},
  journal= {arXiv preprint arXiv:2205.00748},
  year   = {2022}
}

备注

Accepted by TPAMI 2022. arXiv admin note: substantial text overlap with arXiv:2104.01797