中文

从单幅图像对多个人体进行连贯重建

计算机视觉与模式识别 2020-06-16 v1

摘要

本工作中,我们解决从单幅图像进行多人 3D 姿态估计的问题。该问题自顶向下设置中的典型回归方法会先检测所有人体,然后独立重建每一个人体。然而,此类预测存在结果不连贯的问题,例如场景中人物之间的互相穿透与深度排序不一致。我们的目标是训练一个单一网络,学习避免这些问题并生成场景中所有人物的连贯 3D 重建。为此,一个关键设计选择是在我们的自顶向下框架中引入 SMPL 参数化身体模型,其使得两种新损失得以使用。首先,基于距离场的碰撞损失惩罚重建人物之间的互相穿透。其次,深度排序感知损失推理遮挡关系并促成人物的深度排序,从而生成与标注实例分割一致的渲染结果。这为网络提供了深度监督信号,即便图像没有显式 3D 标注。实验表明,我们的方法在标准 3D 姿态基准上优于先前方法,而我们提出的损失实现了自然图像中更连贯的重建。带有视频、结果与代码的项目网站见:https://jiangwenpl.github.io/multiperson

关键词

引用

@article{arxiv.2006.08586,
  title  = {Coherent Reconstruction of Multiple Humans from a Single Image},
  author = {Wen Jiang and Nikos Kolotouros and Georgios Pavlakos and Xiaowei Zhou and Kostas Daniilidis},
  journal= {arXiv preprint arXiv:2006.08586},
  year   = {2020}
}

备注

CVPR 2020. Project Page: https://jiangwenpl.github.io/multiperson/