VTP:用于多视角多人三维姿态估计的体素Transformer
计算机视觉与模式识别
2023-08-07 v1
摘要
本文提出体素Transformer姿态估计器(VTP),这是首个用于多视角多人三维人体姿态估计的三维体素Transformer框架。VTP聚合所有相机视角中二维关键点的特征,并以端到端方式直接在三维体素空间中学习空间关系。聚合后的三维特征先经过三维卷积,再展平为序列嵌入并输入Transformer。设计了一种残差结构以进一步提升性能。此外,采用稀疏Sinkhorn注意力来降低内存开销,这是体素表示的主要瓶颈,同时还能取得优异性能。Transformer的输出再次通过残差设计与三维卷积特征拼接。所提出的VTP框架将Transformer的高性能与体素表示相结合,可作为卷积骨干网络的一种良好替代方案。在Shelf、Campus和CMU Panoptic基准上的实验在平均每个关节位置误差(MPJPE)和正确估计部位百分比(PCP)方面均显示出有前景的结果。我们的代码将公开。
引用
@article{arxiv.2205.12602,
title = {VTP: Volumetric Transformer for Multi-view Multi-person 3D Pose Estimation},
author = {Yuxing Chen and Renshu Gu and Ouhan Huang and Gangyong Jia},
journal= {arXiv preprint arXiv:2205.12602},
year = {2023}
}