基于图与时域卷积网络的单目视频三维多人姿态估计
计算机视觉与模式识别
2021-04-08 v3
摘要
尽管近期取得进展,单目视频的三维多人姿态估计仍具挑战性,原因在于遮挡、部分目标人物出帧以及人物检测不准确所导致的常见信息缺失问题。为应对该问题,我们提出一种集成图卷积网络(GCNs)与时域卷积网络(TCNs)的新框架,可鲁棒估计以相机为中心的多人三维姿态且无需相机参数。特别地,我们引入一种人体关节 GCN,与现有 GCN 不同,其基于有向图并利用二维姿态估计器的置信度分数来改善姿态估计结果。我们还引入人体骨骼 GCN,建模骨连接并提供超越人体关节的更多信息。两个 GCN 协同估计空间逐帧三维姿态,并能利用目标帧中可见关节与骨骼信息估计被遮挡或缺失的人体部位信息。为进一步精炼三维姿态估计,我们使用时域卷积网络(TCNs)施加时域与人体动力学约束。我们使用关节-TCN 跨帧估计以人物为中心的三维姿态,并提出速度-TCN 估计三维关节速度以确保连续帧中三维姿态估计的一致性。最后,为估计多人三维人体姿态,我们提出根-TCN 以估计以相机为中心的三维姿态而无需相机参数。定量与定性评估证明了所提方法的有效性。
引用
@article{arxiv.2012.11806,
title = {Graph and Temporal Convolutional Networks for 3D Multi-person Pose Estimation in Monocular Videos},
author = {Yu Cheng and Bo Wang and Bo Yang and Robby T. Tan},
journal= {arXiv preprint arXiv:2012.11806},
year = {2021}
}
备注
Accepted to AAAI 2021. Code is available at: https://github.com/3dpose/GnTCN