中文

MHFormer:面向三维人体姿态估计的多假设 Transformer

计算机视觉与模式识别 2022-06-29 v4 人工智能 机器学习

摘要

由于深度模糊和自遮挡,从单目视频中估计三维人体姿态是一项具有挑战性的任务。现有工作大多试图通过利用时空关系来解决这两个问题。然而,这些工作忽略了这是一个逆问题,存在多个可行解(即假设)。为缓解这一局限,我们提出了一种多假设 Transformer(Multi-Hypothesis Transformer, MHFormer),用于学习多个合理姿态假设的时空表示。为了有效建模多假设依赖关系并在假设特征之间建立强关联,该任务被分解为三个阶段:(i) 生成多个初始假设表示;(ii) 建模自假设通信,将多个假设合并为单一收敛表示,然后将其划分为多个发散假设;(iii) 学习跨假设通信,并聚合多假设特征以合成最终的三维姿态。通过上述过程,最终表示得到增强,合成的姿态也更加精确。大量实验表明,MHFormer 在两个具有挑战性的数据集 Human3.6M 和 MPI-INF-3DHP 上均取得了最先进的结果。在不使用任何额外技巧的情况下,其在 Human3.6M 上的性能以 3% 的大幅优势超越了此前的最佳结果。代码与模型见:\url{https://github.com/Vegetebird/MHFormer}。

关键词

引用

@article{arxiv.2111.12707,
  title  = {MHFormer: Multi-Hypothesis Transformer for 3D Human Pose Estimation},
  author = {Wenhao Li and Hong Liu and Hao Tang and Pichao Wang and Luc Van Gool},
  journal= {arXiv preprint arXiv:2111.12707},
  year   = {2022}
}

备注

Accepted by CVPR 2022. Open Sourced