基于多视角时空关系变换器的精确三维人体姿态估计
计算机视觉与模式识别
2024-03-26 v2 机器人学
图像与视频处理
摘要
三维人体姿态估计在保留深度信息和物理结构的同时,捕获三维空间中的人体关节点。这对于需要精确姿态信息的应用至关重要,例如人机交互、场景理解和康复训练。由于数据采集的挑战,主流的三维人体姿态估计数据集主要由实验室环境下采集的多视角视频数据构成,这些数据除了图像帧内容外,还包含丰富的时空关联信息。鉴于变换器(Transformer)卓越的自注意力机制能够从多视角视频数据集中捕获时空关联性,我们提出了一种用于三维序列到序列(seq2seq)人体姿态检测的多阶段框架。首先,空间模块通过图像内内容表示人体姿态特征,而帧-图像关系模块则提取多视角图像之间的时序关系和三维空间位置关系特征。其次,采用自注意力机制来消除非人体部位的干扰并减少计算资源。我们在流行的三维人体姿态检测数据集 Human3.6M 上评估了我们的方法。实验结果表明,我们的方法在该数据集上达到了最先进的性能。源代码将在 https://github.com/WUJINHUAN/3D-human-pose 上提供。
引用
@article{arxiv.2401.16700,
title = {Towards Precise 3D Human Pose Estimation with Multi-Perspective Spatial-Temporal Relational Transformers},
author = {Jianbin Jiao and Xina Cheng and Weijie Chen and Xiaoting Yin and Hao Shi and Kailun Yang},
journal= {arXiv preprint arXiv:2401.16700},
year = {2024}
}
备注
Accepted to IJCNN 2024. The source code will be available at https://github.com/WUJINHUAN/3D-human-pose