通过相机解耦表示的轻量级多视角三维姿态估计
计算机视觉与模式识别
2020-06-23 v2
摘要
我们提出一种轻量级方案,从空间标定相机捕获的多视角图像中恢复三维姿态。基于可解释表示学习的最新进展,我们利用三维几何将输入图像融合为统一的姿态潜在表示,该表示与相机视角解耦。这使我们能跨不同视角有效推理三维姿态,而无需使用计算密集的体积网格。我们的架构随后将所学表示以相机投影算子为条件,生成精确的逐视角二维检测,这些检测可通过可微直接线性变换(DLT)层简单提升为三维。为高效实现,我们提出一种新颖的 DLT 实现,在 GPU 架构上比标准基于 SVD 的三角测量方法快数个数量级。我们在两个大规模人体姿态数据集(H36M 和 Total Capture)上评估了我们的方法:我们的方法优于或与最先进的体积方法性能相当,且不同于它们,实现了实时性能。
引用
@article{arxiv.2004.02186,
title = {Lightweight Multi-View 3D Pose Estimation through Camera-Disentangled Representation},
author = {Edoardo Remelli and Shangchen Han and Sina Honari and Pascal Fua and Robert Wang},
journal= {arXiv preprint arXiv:2004.02186},
year = {2020}
}