中文

具身场景感知的人体姿态估计

计算机视觉与模式识别 2022-10-17 v3

摘要

我们提出具身场景感知的人体姿态估计,基于模拟智能体的本体感知和场景感知,以及外部的第三人称观察来估计三维姿态。与以往通常采用多阶段优化、非因果推理和复杂接触建模来估计人体姿态和人景交互的方法不同,我们的方法是单阶段的、因果的,并在模拟环境中恢复全局三维人体姿态。由于二维第三人称观察与相机姿态耦合,我们提出解耦相机姿态,并使用在全局坐标系中定义的多步投影梯度作为我们具身智能体的运动线索。利用物理模拟和预扫描的场景(例如三维网格),我们在日常环境(图书馆、办公室、卧室等)中模拟我们的智能体,并为其配备环境传感器,以智能导航并与场景几何体交互。我们的方法也仅依赖于二维关键点,并可在源自流行人体运动数据库的合成数据集上进行训练。为进行评估,我们使用流行的 H36M 和 PROX 数据集,并在具有挑战性的 PROX 数据集上实现了高质量的姿态估计,且从未使用 PROX 运动序列进行训练。代码和视频可在项目页面上获取。

关键词

引用

@article{arxiv.2206.09106,
  title  = {Embodied Scene-aware Human Pose Estimation},
  author = {Zhengyi Luo and Shun Iwase and Ye Yuan and Kris Kitani},
  journal= {arXiv preprint arXiv:2206.09106},
  year   = {2022}
}

备注

NeurIPS 2022. Project website: https://zhengyiluo.github.io/projects/embodied_pose/. Zhengyi Luo and Shun Iwase contributed equally