中文

结合人类语义信息的多人网格和多视图相机同步恢复

计算机视觉与模式识别 2024-12-30 v1

摘要

动态多人网格恢复在体育转播、虚拟现实和视频游戏等领域具有广泛应用前景。然而,当前的多视图框架依赖耗时的相机标定程序。本文聚焦于使用未标定相机进行多人运动捕捉,主要面临两个挑战:一个是人与人之间的相互作用和遮挡会为相机标定和运动捕捉引入固有的歧义;另一个是缺乏可用于约束稀疏相机几何的密集对应关系。在我们的关键思想是将运动先验知识纳入,以同时估计相机参数和人类网格,从而从噪声人类语义信息中恢复。我们首先利用2D图像中的人类信息初始化内参和外参,从而无需任何其他标定工具或背景特征。随后,引入姿态-几何一致性,将来自不同视图中检测到的人群关联起来。最后,提出一种潜在运动先验来细化相机参数和人类运动。实验结果表明,通过一种一步重建即可获得准确的相机参数和人类运动。相关代码已公开于\url{https://github.com/boycehbz/DMMR}。

关键词

引用

@article{arxiv.2412.18785,
  title  = {Simultaneously Recovering Multi-Person Meshes and Multi-View Cameras with Human Semantics},
  author = {Buzhen Huang and Jingyi Ju and Yuan Shu and Yangang Wang},
  journal= {arXiv preprint arXiv:2412.18785},
  year   = {2024}
}

备注

TCSVT. arXiv admin note: text overlap with arXiv:2110.10355