中文

TransFusion:基于 Transformer 的跨视图融合用于 3D 人体姿态估计

计算机视觉与模式识别 2021-12-10 v3

摘要

在已标定的多视图 3D 姿态估计中,估计每个视图的 2D 人体姿态通常是第一步。但 2D 姿态检测器的性能在遮挡和倾斜视角等挑战性情况下会受到影响。为了应对这些挑战,先前的工作从对极几何推导出不同视图间的点对点对应关系,并利用这些对应关系来合并预测热力图或特征表示。不同于预测后合并/标定,我们在此引入一个用于多视图 3D 姿态估计的 Transformer 框架,旨在通过整合来自不同视图的信息来直接改进单个 2D 预测器。受先前多模态 Transformer 的启发,我们设计了一个统一的 Transformer 架构,名为 TransFusion,以融合来自当前视图和相邻视图的线索。此外,我们提出了对极场的概念,以将 3D 位置信息编码到 Transformer 模型中。由对极场引导的 3D 位置编码提供了一种编码不同视图像素间对应关系的有效方式。在 Human 3.6M 和 Ski-Pose 上的实验表明,与其他融合方法相比,我们的方法更高效且有一致的改进。具体而言,在 Human 3.6M 上,仅需 5M 参数且在 256 x 256 分辨率下,我们即实现了 25.8 mm 的 MPJPE。

关键词

引用

@article{arxiv.2110.09554,
  title  = {TransFusion: Cross-view Fusion with Transformer for 3D Human Pose Estimation},
  author = {Haoyu Ma and Liangjian Chen and Deying Kong and Zhe Wang and Xingwei Liu and Hao Tang and Xiangyi Yan and Yusheng Xie and Shih-Yao Lin and Xiaohui Xie},
  journal= {arXiv preprint arXiv:2110.09554},
  year   = {2021}
}

备注

BMVC 2021. Code is available at: https://github.com/HowieMa/TransFusion-Pose