提升与上采样:基于提升 Transformer 的高效三维人体姿态估计
计算机视觉与模式识别
2022-10-24 v3
摘要
视频中单目三维人体姿态估计的当前最优范式由二维到三维姿态提升主导。尽管提升方法本身相当高效,真实计算复杂度取决于逐帧二维姿态估计。本文提出一种基于 Transformer 的姿态提升方案,可处理时间稀疏的二维姿态序列,仍产出时间稠密的三维姿态估计。我们展示了如何利用掩码令牌建模在 Transformer 块内实现时间上采样。这得以解耦输入二维姿态的采样率与视频目标帧率,并大幅降低总计算复杂度。此外,我们探索了在大型动作捕捉档案上预训练的选项,此前该方向很大程度上被忽视。我们在两个流行基准数据集 Human3.6M 与 MPI-INF-3DHP 上评估方法。所提方法分别以 45.0 mm 与 46.9 mm 的 MPJPE 媲美当前最优,同时将推理时间降低 12 倍。这实现了在固定与移动应用中借助普通消费级硬件的实时吞吐。我们在 https://github.com/goldbricklemon/uplift-upsample-3dhpe 发布代码与模型。
引用
@article{arxiv.2210.06110,
title = {Uplift and Upsample: Efficient 3D Human Pose Estimation with Uplifting Transformers},
author = {Moritz Einfalt and Katja Ludwig and Rainer Lienhart},
journal= {arXiv preprint arXiv:2210.06110},
year = {2022}
}
备注
Accepted at IEEE/CVF WACV 2023