FBI-Pose:利用前向或后向信息弥合二维图像与三维人体姿态之间差距
计算机视觉与模式识别
2018-06-26 v1
摘要
尽管利用深度卷积神经网络(ConvNet)从图像进行人体姿态估计已取得显著进展,但在自然场景下执行三维姿态推断仍是一大挑战。这是由于难以获取户外环境的三维姿态真值。本文提出一种新框架,通过利用每根骨骼相对于相机视角指示其前向或后向的信息(我们称之为前向或后向信息,缩写为 FBI)来解决该问题。我们的方法首先训练一个双分支 ConvNet,将人体图像映射至二维关节位置及骨骼的 FBI。这些信息进一步输入深度回归网络以预测关节的三维位置。为支持训练,我们还开发了标注用户界面,并从 MPII(一个公开二维姿态标注数据集)随机选取约 12K 张自然场景图像标注了此类 FBI。我们在标准基准上的实验结果表明,我们的方法在定性与定量上均优于当前最优(state-of-the-art)方法。
引用
@article{arxiv.1806.09241,
title = {FBI-Pose: Towards Bridging the Gap between 2D Images and 3D Human Poses using Forward-or-Backward Information},
author = {Yulong Shi and Xiaoguang Han and Nianjuan Jiang and Kun Zhou and Kui Jia and Jiangbo Lu},
journal= {arXiv preprint arXiv:1806.09241},
year = {2018}
}
备注
9 pages, 5 figures