中文

基于无标注数据的多人三维姿态估计

计算机视觉与模式识别 2024-04-10 v3 人工智能

摘要

众多的应用使得多人三维姿态估计成为一个影响深远的研究领域。然而,假设一个由若干常规 RGB 相机组成的多视角系统,三维多人姿态估计面临若干挑战。首先,必须在不同视角中唯一标识每个人,以分离相机提供的二维信息。其次,从每人的多视角二维信息进行三维姿态估计的过程必须对环境中的噪声和潜在遮挡具有鲁棒性。在本工作中,我们借助深度学习应对这两个挑战。具体而言,我们提出一个基于图神经网络(Graph Neural Networks)的模型,能够预测场景中人的跨视角对应关係,以及一个多层感知机(Multilayer Perceptron),其接收二维点并输出每人的三维姿态。这两个模型以自监督方式训练,从而避免了需要带有三维标注的大型数据集。

关键词

引用

@article{arxiv.2212.08731,
  title  = {Multi-person 3D pose estimation from unlabelled data},
  author = {Daniel Rodriguez-Criado and Pilar Bachiller and George Vogiatzis and Luis J. Manso},
  journal= {arXiv preprint arXiv:2212.08731},
  year   = {2024}
}