MPM:通过掩码姿态建模的统一二维-三维人体姿态表征
计算机视觉与模式识别
2024-07-16 v2
摘要
仅从二维人体姿态序列估计三维人体姿态在近年来已被充分探索。然而,在此之前,尚无此类工作尝试在共享特征空间中统一二维与三维姿态表征。本文中,我们提出 \mpm,一种通过掩码姿态建模的统一二维-三维人体姿态表征框架。我们将二维与三维姿态视为如视觉与语言般两种不同的模态,并构建单流基于 transformer 的架构。我们应用两个预训练任务,即掩码二维姿态建模与掩码三维姿态建模来预训练我们的网络,并使用全监督进行进一步微调。总掩码率高达 的时空掩码采样策略在空间和时域均带来更好的关系建模。\mpm~可在\textbf{单一}框架中处理多项任务,包括三维人体姿态估计、从遮挡二维姿态的三维姿态估计以及三维姿态补全。我们在多个广泛使用的人体姿态数据集上进行了大量实验与消融研究,并在 MPI-INF-3DHP 上取得最先进性能。
引用
@article{arxiv.2306.17201,
title = {MPM: A Unified 2D-3D Human Pose Representation via Masked Pose Modeling},
author = {Zhenyu Zhang and Wenhao Chai and Zhongyu Jiang and Tian Ye and Mingli Song and Jenq-Neng Hwang and Gaoang Wang},
journal= {arXiv preprint arXiv:2306.17201},
year = {2024}
}
备注
Accepted by PRCV2024