中文

Holistic++ 场景理解:结合人机交互与物理常识的单视图三维整体场景解析及人体姿态估计

计算机视觉与模式识别 2019-09-05 v1

摘要

我们提出一种新的三维 holistic++ 场景理解问题,其从单视图图像联合解决两项任务:(i) 整体场景解析与重建——物体包围盒、相机位姿和房间布局的三维估计,以及 (ii) 三维人体姿态估计。其背后的直觉是利用这两项任务间的耦合特性来提升场景理解的粒度与性能。我们提出利用这两项任务间两个关键且本质的联系:(i) 人机交互 (HOI) 以建模场景中智能体与物体间的细粒度关系,以及 (ii) 物理常识以建模重建场景的物理合理性。由解析图表示的该三维场景的最优配置使用马尔可夫链蒙特卡洛 (MCMC) 进行推断,其高效地遍历不可微的联合解空间。实验结果表明,所提算法在三个数据集上显著提升了两项任务的性能,展现出改进的泛化能力。

关键词

引用

@article{arxiv.1909.01507,
  title  = {Holistic++ Scene Understanding: Single-view 3D Holistic Scene Parsing and Human Pose Estimation with Human-Object Interaction and Physical Commonsense},
  author = {Yixin Chen and Siyuan Huang and Tao Yuan and Siyuan Qi and Yixin Zhu and Song-Chun Zhu},
  journal= {arXiv preprint arXiv:1909.01507},
  year   = {2019}
}

备注

Accepted by ICCV 2019