中文

SoloPose:基于视频数据增强的一次性运动学 3D 人体姿态估计

计算机视觉与模式识别 2023-12-19 v1 人工智能

摘要

虽然近期的两阶段多对一深度学习模型在 3D 人体姿态估计中取得了巨大成功,但与一次性和多对多模型相比,此类模型在检测连续视频中的 3D 关键点时效率低下。两阶段和多对一模型的另一个关键缺点是第一阶段的错误会传递到第二阶段。在本文中,我们引入了 SoloPose,一种用于视频运动学 3D 人体姿态估计的新型一次性、多对多时空 Transformer 模型。SoloPose 进一步由 HeatPose 增强,这是一种基于高斯混合模型分布的 3D 热图,它将目标关键点以及运动学上相邻的关键点进行分解。最后,我们通过 3D AugMotion 工具包解决了数据多样性约束,这是一种增强现有 3D 人体姿态数据集的方法,具体做法是将四个顶级的公共 3D 人体姿态数据集(Humans3.6M、MADS、AIST Dance++、MPI INF 3DHP)投影到一个具有通用坐标系的新数据集(Humans7.1M)中。在 Human3.6M 以及增强的 Humans7.1M 数据集上进行了大量实验,SoloPose 展示了相对于最先进方法的优越结果。

关键词

引用

@article{arxiv.2312.10195,
  title  = {SoloPose: One-Shot Kinematic 3D Human Pose Estimation with Video Data Augmentation},
  author = {David C. Jeong and Hongji Liu and Saunder Salazar and Jessie Jiang and Christopher A. Kitts},
  journal= {arXiv preprint arXiv:2312.10195},
  year   = {2023}
}

备注

8 pages, 6 figures