中文

几何偏置Transformer用于鲁棒的多视角3D人体姿态重建

计算机视觉与模式识别 2023-12-29 v1

摘要

我们解决了在遮挡和有限重叠视角下从多视角估计3D人体姿态的挑战。我们将多视角单人3D人体姿态重建视为回归问题,并提出一种新颖的编码器-解码器Transformer架构,从多视角2D姿态序列估计3D姿态。编码器精炼在不同视角和时间检测到的2D骨架关节点,通过全局自注意力融合多视角和时间信息。我们通过引入几何偏置注意力机制来增强编码器,有效利用视角之间的几何关系。此外,我们使用2D姿态检测器提供的检测分数,根据2D检测的可靠性进一步引导编码器的注意力。解码器随后从这些精炼的令牌回归3D姿态序列,使用每个关节预定义的查询。为了增强方法对未见场景的泛化能力并提高对缺失关节的鲁棒性,我们实施了包括场景居中、合成视角和令牌丢弃等策略。我们在三个基准公开数据集Human3.6M、CMU Panoptic和Occlusion-Persons上进行了大量实验。我们的结果证明了方法的有效性,特别是在遮挡场景和可用视角较少的情况下,这些传统上对基于三角测量的方法具有挑战性。

关键词

引用

@article{arxiv.2312.17106,
  title  = {Geometry-Biased Transformer for Robust Multi-View 3D Human Pose Reconstruction},
  author = {Olivier Moliner and Sangxia Huang and Kalle Åström},
  journal= {arXiv preprint arXiv:2312.17106},
  year   = {2023}
}

备注

Accepted: 18th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2024)