将人置于其所在位置:单目回归图像中人物的三维深度
计算机视觉与模式识别
2022-04-21 v3
摘要
给定一张包含多人的图像,我们的目标是直接回归所有人体的姿态与形状及其相对深度。然而,在不知晓人物身高的情况下,推断图像中人物的深度在根本上具有歧义性。当场景包含体型差异极大的人物(如从婴儿到成人)时,这一问题尤为突出。为此,我们需要若干条件。首先,我们开发了一种推断单张图像中多人姿态与深度的新方法。先前估计多人的工作是在图像平面上进行推理,而我们的方法BEV增加了一个虚拟的鸟瞰图(Bird's-Eye-View)表示以显式推理深度。BEV同时推理图像中的身体中心与深度中的身体中心,并通过结合二者估计三维身体位置。与已有工作不同,BEV是一种端到端可微的单阶段方法。其次,身高随年龄变化,使得在不估计图像中人物年龄的情况下无法消解深度。为此,我们利用一个3D身体模型空间,使BEV能够推断从婴儿到成人的形状。第三,为训练BEV,我们需要一个新数据集。具体而言,我们创建了“Relative Human”(RH)数据集,其包含年龄标签及图像中人物间的相对深度关系。在RH与AGORA上的大量实验证明了模型与训练方案的有效性。BEV在深度推理、儿童形状估计及遮挡鲁棒性上均优于现有方法。代码与数据集已发布供研究使用。
引用
@article{arxiv.2112.08274,
title = {Putting People in their Place: Monocular Regression of 3D People in Depth},
author = {Yu Sun and Wu Liu and Qian Bao and Yili Fu and Tao Mei and Michael J. Black},
journal= {arXiv preprint arXiv:2112.08274},
year = {2022}
}
备注
CVPR 2022; Code https://github.com/Arthur151/ROMP ; Dataset https://github.com/Arthur151/Relative_Human