用于鲁棒动作捕捉的双掩码自编码器及时空骨骼令牌补全
计算机视觉与模式识别
2022-07-18 v1
摘要
由于严重遮挡、快速身体运动和复杂交互引起的歧义,多人动作捕捉可能具有挑战性。现有框架基于 2D 姿态估计,并通过推理多相机观测间的外观、轨迹和几何一致性三角化到 3D 坐标。然而,由于观测角度有限,2D 关节检测通常不完整且身份分配错误,导致含噪的 3D 三角化结果。为克服该问题,我们提出利用 transformer 探索骨骼运动的短程自回归特性。首先,我们提出一种自适应、身份感知的三角化模块来重建 3D 关节并识别每个身份的缺失关节。为生成完整的 3D 骨骼运动,我们进而提出一种双掩码自编码器(D-MAE),其通过骨骼结构编码与时序位置编码对关节状态进行编码以完成轨迹。D-MAE 灵活的掩码与编码机制使得任意骨骼定义可方便地部署于同一框架下。为展示所提模型在处理严重数据丢失场景下的能力,我们贡献了一个高精度且具挑战性的多人交互严重遮挡动作捕捉数据集。在基准数据集和我们的新数据集上的评估证明了我们所提模型的效率,以及其相对于其他最先进方法的优势。
引用
@article{arxiv.2207.07381,
title = {A Dual-Masked Auto-Encoder for Robust Motion Capture with Spatial-Temporal Skeletal Token Completion},
author = {Junkun Jiang and Jie Chen and Yike Guo},
journal= {arXiv preprint arXiv:2207.07381},
year = {2022}
}