中文

基于 3D 表示的多人跟踪

计算机视觉与模式识别 2021-11-16 v1

摘要

我们提出了一种在视频中跟踪多人的新方法。与以往采用 2D 表示的方法不同,我们专注于使用位于三维空间中的人的 3D 表示。为此,我们开发了人体网格与外观恢复(HMAR)方法,该方法除了将人的 3D 几何提取为 SMPL 网格外,还将外观提取为网格三角面上的纹理贴图。这作为一种对视角与姿态变化具有鲁棒性的 3D 外观表示。给定一段视频片段,我们首先检测对应于人的边界框,并对每一个使用 HMAR 提取 3D 外观、姿态与位置信息。这些嵌入向量随后被送入一个 transformer,用于对序列持续时间内表示进行时空聚合。所得表示之间的相似性被用于求解将每个人分配到轨迹片段的关联问题。我们在 Posetrack、MuPoTs 与 AVA 数据集上评估了我们的方法。我们发现,在这些设定下 3D 表示比 2D 表示更有效地用于跟踪,并且我们取得了最先进的性能。代码与结果见:https://brjathu.github.io/T3DP。

关键词

引用

@article{arxiv.2111.07868,
  title  = {Tracking People with 3D Representations},
  author = {Jathushan Rajasegaran and Georgios Pavlakos and Angjoo Kanazawa and Jitendra Malik},
  journal= {arXiv preprint arXiv:2111.07868},
  year   = {2021}
}