中文

用于三维人体姿态估计的自适应多视角与时序融合 Transformer

计算机视觉与模式识别 2022-07-05 v2

摘要

本文提出一个名为多视角与时序融合 Transformer(MTF-Transformer)的统一框架,在三维人体姿态估计(HPE)中无需相机标定即可自适应处理变化的视角数与视频长度。其由特征提取器、多视角融合 Transformer(MFT)和时序融合 Transformer(TFT)组成。特征提取器从每幅图像估计二维姿态,并根据置信度融合预测结果。其提供聚焦姿态的特征嵌入,并使后续模块计算轻量。MFT 通过新颖的相对注意力(Relative-Attention)块融合变数量视角的特征,自适应度量各视角对之间的隐式相对关系并重建更具信息的特征。TFT 聚合整个序列的特征并通过 transformer 预测三维姿态,自适应处理任意长度视频并充分利用时序信息。transformer 的引入使模型能更好地学习空间几何,并对变化的应用场景保持鲁棒。我们在 Human3.6M、TotalCapture 和 KTH Multiview Football II 上报告了定量与定性结果。相较于使用相机参数的 SOTA 方法,MTF-Transformer 取得具竞争力的结果,并对含任意数量未知视角的动态捕捉具有良好的泛化能力。

关键词

引用

@article{arxiv.2110.05092,
  title  = {Adaptive Multi-view and Temporal Fusing Transformer for 3D Human Pose Estimation},
  author = {Hui Shuai and Lele Wu and Qingshan Liu},
  journal= {arXiv preprint arXiv:2110.05092},
  year   = {2022}
}