捕捉每个关节的运动:基于独立 token 的 3D 人体姿态与形状估计
计算机视觉与模式识别
2023-03-02 v1
摘要
本文提出一种从单目视频估计 3D 人体姿态与形状的新方法。该任务需要直接从单目图像或视频中恢复像素对齐的 3D 人体姿态和体型,由于其固有的模糊性而具有挑战性。为提高精度,现有方法高度依赖于以迭代误差反馈方式作为先验估计和参数回归的初始平均姿态和形状。此外,基于视频的方法对图像级特征上的整体变化进行建模以在时间上增强单帧特征,但未能捕捉关节级别的旋转运动,且无法保证局部时间一致性。为解决这些问题,我们提出了一种基于 Transformer 的新模型,其设计了独立 token。首先,我们引入三类独立于图像特征的 token:关节旋转 token、形状 token 和相机 token。这些 token 通过 Transformer 层与图像特征逐步交互,学习从大规模数据中编码人体 3D 关节旋转、体型和位置信息的先验知识,并针对给定图像更新以估计 SMPL 参数。其次,得益于所提出的基于 token 的表示,我们进一步使用时间模型专注于捕捉每个关节的旋转时间信息,经验上有助于防止局部部位的大抖动。尽管概念简单,所提方法在 3DPW 和 Human3.6M 数据集上取得了优越性能。使用 ResNet-50 和 Transformer 架构,其在具有挑战性的 3DPW 的 PA-MPJPE 指标上获得 42.0 mm 误差,大幅优于最先进的同类方法。代码将公开于 https://github.com/yangsenius/INT_HMR_Model
引用
@article{arxiv.2303.00298,
title = {Capturing the motion of every joint: 3D human pose and shape estimation with independent tokens},
author = {Sen Yang and Wen Heng and Gang Liu and Guozhong Luo and Wankou Yang and Gang Yu},
journal= {arXiv preprint arXiv:2303.00298},
year = {2023}
}
备注
17 pages, 12 figures. ICLR 2023 (spotlight)