基于时序卷积与半监督训练的视频三维人体姿态估计
计算机视觉与模式识别
2019-04-01 v2
摘要
在本工作中,我们证明视频中的三维姿态可通过基于膨胀时序卷积在二维关键点上的全卷积模型有效估计。我们还引入反向投影,一种简单而有效的半监督训练方法,其利用无标签视频数据。我们从无标签视频的预测二维关键点出发,估计三维姿态,最后反向投影回输入的二维关键点。在有监督设定下,我们的全卷积模型在 Human3.6M 上比文献中先前最佳结果每关节平均位置误差低 6 mm,对应误差降低 11%,且该模型在 HumanEva-I 上也显示出显著改进。此外,反向投影实验表明,在标签数据稀缺的半监督设定下,它轻松优于先前最先进的结果。代码与模型见 https://github.com/facebookresearch/VideoPose3D
引用
@article{arxiv.1811.11742,
title = {3D human pose estimation in video with temporal convolutions and semi-supervised training},
author = {Dario Pavllo and Christoph Feichtenhofer and David Grangier and Michael Auli},
journal= {arXiv preprint arXiv:1811.11742},
year = {2019}
}
备注
CVPR 2019