基于自注意力的视频三维人体姿态与形状估计
计算机视觉与模式识别
2021-09-08 v2
摘要
我们考虑从视频中估计三维人体姿态与形状的任务。尽管现有的基于帧的方法已取得显著进展,这些方法独立应用于每幅图像,因此常导致不一致的预测。本工作中,我们提出一种基于视频的学习算法用于三维人体姿态与形状估计。我们方法的关键见解有两方面。首先,为解决时间预测不一致问题,我们利用视频中的时间信息并提出一种自注意力模块,联合考虑跨帧的短程与长程依赖,从而得到时间上连贯的估计。其次,我们用一个预测模块对人体运动建模,使相邻帧间的过渡平滑。我们在3DPW、MPI-INF-3DHP和Human3.6M数据集上评估了我们的方法。大量实验结果表明,我们的算法优于当前最优方法。
引用
@article{arxiv.2103.14182,
title = {Self-Attentive 3D Human Pose and Shape Estimation from Videos},
author = {Yun-Chun Chen and Marco Piccirilli and Robinson Piramuthu and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2103.14182},
year = {2021}
}
备注
This paper is under consideration at Computer Vision and Image Understanding