面向基于视频的人体姿态与形状恢复的时间感知细化
计算机视觉与模式识别
2023-11-17 v1
摘要
尽管近年来从单目 RGB 图像恢复人体姿态与形状已取得显著进展,但从视频中获取具有高精度与时间一致性的三维人体运动仍具挑战。现有基于视频的方法倾向于从全局图像特征重建人体运动,缺乏细节表征能力并限制了重建精度。本文提出一种时间感知细化网络(TAR),同步探索时间感知的全局与局部图像特征以实现精确姿态与形状恢复。首先,引入全局 transformer 编码器从静态特征序列中获取时间全局特征。其次,双向 ConvGRU 网络以高分辨率特征图序列为输入,输出保持高分辨率并捕捉人体局部运动的时间局部特征图。最后,循环细化模块利用全局与局部时间信息迭代更新估计的 SMPL 参数,以获得准确且平滑的结果。大量实验表明,我们的 TAR 在 3DPW、MPI-INF-3DHP 和 Human3.6M 等主流基准上取得了优于以往 SOTA 方法的更准确结果。
引用
@article{arxiv.2311.09543,
title = {Temporal-Aware Refinement for Video-based Human Pose and Shape Recovery},
author = {Ming Chen and Yan Zhou and Weihua Jian and Pengfei Wan and Zhongyuan Wang},
journal= {arXiv preprint arXiv:2311.09543},
year = {2023}
}
备注
20 pages, 12 figures