XNect:使用单台 RGB 相机的实时多人 3D 动作捕捉
计算机视觉与模式识别
2020-05-01 v2 图形学
摘要
我们提出一种以超过 30 fps 使用单台 RGB 相机进行多人 3D 动作捕捉的实时方法。它能在可能包含物体及其他人遮挡的通用场景中成功运行。我们的方法分后续阶段进行。第一阶段是一个卷积神经网络(CNN),为所有个体的所有可见关节估计 2D 与 3D 姿态特征以及身份分配。我们为该系统贡献了一种称为 SelecSLS Net 的新 CNN 架构,其使用新颖的选择性长程与短程跳跃连接来改善信息流,从而在不牺牲精度的情况下大幅加快网络速度。在第二阶段,一个全连接神经网络将每个主体可能部分的(因遮挡所致)2D 姿态与 3D 姿态特征转换为每个个体的完整 3D 姿态估计。第三阶段对预测的每主体 2D 与 3D 姿态应用时空骨骼模型拟合,以进一步调和 2D 与 3D 姿态,并强制时间一致性。我们的方法返回每个主体的以关节角表示的完整骨骼姿态。这是与先前工作的进一步关键区别,后者不为多人场景实时产生连贯骨骼的关节角结果。所提出的系统在消费级硬件上以先前未见的速度运行,给定 512x320 图像作为输入时超过 30 fps,同时达到最先进精度,我们将在一系列具有挑战性的真实场景中予以展示。
引用
@article{arxiv.1907.00837,
title = {XNect: Real-time Multi-Person 3D Motion Capture with a Single RGB Camera},
author = {Dushyant Mehta and Oleksandr Sotnychenko and Franziska Mueller and Weipeng Xu and Mohamed Elgharib and Pascal Fua and Hans-Peter Seidel and Helge Rhodin and Gerard Pons-Moll and Christian Theobalt},
journal= {arXiv preprint arXiv:1907.00837},
year = {2020}
}
备注
To appear in ACM Transactions on Graphics (SIGGRAPH) 2020