Light3DPose:基于多视角的实时多人3D姿态估计
计算机视觉与模式识别
2020-04-07 v1 神经与进化计算
摘要
我们提出了一种从少量标定相机视角进行多人3D姿态估计的方法。我们的架构利用最近提出的反投影层,将来自2D姿态估计器骨干网络的特征图聚合为3D场景的综合表示。该中间表示随后由全卷积体积网络和解码阶段进行处理,以提取具有亚体素精度的3D骨架。我们的方法在CMU Panoptic数据集上使用少量未见过视角实现了SOTA的MPJPE,甚至在单输入视角下也取得了具有竞争力的结果。我们还通过在公开的Shelf数据集上进行测试来评估模型的迁移学习能力,获得了良好的性能指标。所提出的方法本质上是高效的:作为一种纯自底向上的方法,其计算量与场景中的人数无关。此外,尽管2D部分的计算负担随输入视角数量线性增加,整体架构仍能利用非常轻量级的2D骨干网络,其速度比体积对应物快几个数量级,从而实现了快速推理。该系统可在单张1080Ti GPU上以6 FPS运行,处理多达10个相机视角。
引用
@article{arxiv.2004.02688,
title = {Light3DPose: Real-time Multi-Person 3D PoseEstimation from Multiple Views},
author = {Alessio Elmi and Davide Mazzini and Pietro Tortella},
journal= {arXiv preprint arXiv:2004.02688},
year = {2020}
}