三维人体姿态估计中的上下文建模:统一视角
计算机视觉与模式识别
2021-03-31 v2
摘要
从单幅图像估计三维人体姿态存在严重的歧义性,因为多个三维关节构型可能具有相同的二维投影。最先进的方法通常依赖上下文建模方法,如 pictoral structure model (PSM,图像结构模型) 或 graph neural network (GNN,图神经网络),以减少歧义。然而,尚无研究对它们进行严格的并排比较。因此我们首先给出上下文建模的一般公式,其中PSM和GNN均为其特例。通过比较两种方法,我们发现GNN中的端到端训练方案与PSM中的肢体长度约束是提升结果的两个互补因素。为结合二者优势,我们提出基于注意力机制的ContextPose,其允许在深度网络中施加软肢体长度约束。该方法有效降低了得到肢体长度错误的荒谬三维姿态估计的概率,并在两个基准数据集上取得最先进结果。更重要的是,将肢体长度约束引入深度网络使该方法实现了更好的泛化性能。
引用
@article{arxiv.2103.15507,
title = {Context Modeling in 3D Human Pose Estimation: A Unified Perspective},
author = {Xiaoxuan Ma and Jiajun Su and Chunyu Wang and Hai Ci and Yizhou Wang},
journal= {arXiv preprint arXiv:2103.15507},
year = {2021}
}