用于多视角三维人体姿态估计的自学习规范空间
计算机视觉与模式识别
2024-04-01 v2
摘要
多视角三维人体姿态估计自然优于单视角估计,这得益于多视角图像提供的更全面的信息。这些信息包括相机位姿、二维/三维人体姿态和三维几何。然而,这些信息的精确标注难以获取,使得从多视角图像中预测精确的三维人体姿态具有挑战性。为解决这一问题,我们提出了一个完全自监督的框架,名为级联多视角聚合网络(CMANet),以构建一个规范参数空间,整体地整合和利用多视角信息。在我们的框架中,多视角信息被分为两类:1)视角内信息,2)视角间信息。相应地,CMANet 由两个组件构成:视角内模块(IRV)和视角间模块(IEV)。IRV 用于提取每个视角的初始相机位姿和三维人体姿态;IEV 用于融合互补的姿态信息和跨视角三维几何,以获得最终的三维人体姿态。为促进视角内和视角间信息的聚合,我们定义了一个规范参数空间,由每个视角的相机位姿以及 SMPL 模型的人体姿态和形状参数( 和 )描述,并提出了一个两阶段学习过程。在第一阶段,IRV 学习估计相机位姿和视角相关的三维人体姿态,由现成的二维关键点检测器的置信输出进行监督。在第二阶段,IRV 被冻结,IEV 通过隐式编码跨视角互补性和三维几何约束,进一步优化相机位姿并优化三维人体姿态,这通过联合拟合预测的多视角二维关键点来实现。综合实验证明了所提出的框架、模块和学习策略的有效性,并且在广泛的定量和定性分析中,CMANet 优于当前最先进的方法。
引用
@article{arxiv.2403.12440,
title = {Self-learning Canonical Space for Multi-view 3D Human Pose Estimation},
author = {Xiaoben Li and Mancheng Meng and Ziyan Wu and Terrence Chen and Fan Yang and Dinggang Shen},
journal= {arXiv preprint arXiv:2403.12440},
year = {2024}
}