SPEC:利用估计相机在真实场景中重建人体
计算机视觉与模式识别
2022-11-02 v2
摘要
由于缺乏真实场景图像的相机参数信息,现有的三维人体姿态与形状(HPS)估计方法做了若干简化假设:弱透视投影、大恒定焦距以及零相机旋转。这些假设常常不成立,我们定量和定性地表明它们会导致重建的三维形状与姿态出现误差。为此,我们提出 SPEC,这是首个从单张图像估计透视相机并借此更准确地重建三维人体的真实场景三维 HPS 方法。首先,我们训练一个神经网络,在给定输入图像时估计视场角、相机俯仰角和滚转角。我们采用了新颖的损失函数,相比先前工作提升了标定精度。随后我们训练一个新颖的网络,将相机标定结果与图像特征拼接,并利用二者共同回归三维人体形状与姿态。在标准基准(3DPW)以及两个具有更具挑战性相机视角和变化焦距的新数据集上,SPEC 均比先前方法更准确。具体而言,我们创建了一个带有真实三维人体标注的新照片级真实感合成数据集(SPEC-SYN),以及一个带有标定信息和高精度参考人体的新颖真实场景数据集(SPEC-MTP)。定性与定量分析均证实,在推理时已知相机参数可回归出更好的人体。代码与数据集已发布于 https://spec.is.tue.mpg.de 供研究使用。
引用
@article{arxiv.2110.00620,
title = {SPEC: Seeing People in the Wild with an Estimated Camera},
author = {Muhammed Kocabas and Chun-Hao P. Huang and Joachim Tesch and Lea Müller and Otmar Hilliges and Michael J. Black},
journal= {arXiv preprint arXiv:2110.00620},
year = {2022}
}