中文

从多视角重建近距离人体交互

计算机视觉与模式识别 2024-01-30 v1

摘要

本文解决了重建由多个标定相机捕获的处于近距离交互中的多个个体姿态这一具有挑战性的任务。困难源于人际遮挡导致的噪声或错误 2D 关键点检测、由于近距离交互导致的将关键点关联到个体的严重歧义,以及由于在拥挤场景中收集和标注运动数据资源密集而导致的训练数据稀缺。我们引入了一种新颖的系统来应对这些挑战。我们的系统集成了一种基于学习的姿态估计组件及其相应的训练和推理策略。姿态估计组件以多视角 2D 关键点热力图为输入,并使用 3D 条件体积网络重建每个个体的姿态。由于该网络不需要图像作为输入,我们可以利用测试场景中的已知相机参数和大量现有的动作捕捉数据来合成海量训练数据,以模拟测试场景中的真实数据分布。大量实验表明,我们的方法在姿态精度方面显著优于以前的方法,并且在各种相机设置和人群规模上具有泛化能力。代码可在我们的项目页面获取:https://github.com/zju3dv/CloseMoCap。

关键词

引用

@article{arxiv.2401.16173,
  title  = {Reconstructing Close Human Interactions from Multiple Views},
  author = {Qing Shuai and Zhiyuan Yu and Zhize Zhou and Lixin Fan and Haijun Yang and Can Yang and Xiaowei Zhou},
  journal= {arXiv preprint arXiv:2401.16173},
  year   = {2024}
}

备注

SIGGRAPH Asia 2023