从合成数据学习人体姿态模型用于鲁棒RGB-D动作识别
计算机视觉与模式识别
2018-05-02 v2
摘要
我们提出人体姿态模型(Human Pose Models),其表示RGB和深度图像中的人体姿态,且独立于衣物纹理、背景、光照条件、体型和相机视角。学习此类通用模型需要针对每个人体姿态改变所有因素的训练图像。捕获这样的数据成本高得令人望而却步。因此,我们开发了一个用于合成训练数据的框架。首先,我们从大规模真实动作捕捉人体骨架数据语料库中学习代表性人体姿态。接下来,我们将具有不同体型的合成3D人体拟合到每个姿态,并从180个相机视角进行渲染,同时随机改变衣物纹理、背景和光照。采用生成对抗网络(Generative Adversarial Networks,GAN)来最小化合成与真实图像分布之间的差距。然后学习CNN模型,将人体姿态迁移到共享的高级不变空间。随后,学习到的CNN模型被用作来自真实RGB和深度人体动作视频帧的不变特征提取器,时间变化由傅里叶时间金字塔(Fourier Temporal Pyramid)建模。最后,使用线性SVM进行分类。在三个基准跨视角人体动作数据集上的实验表明,我们的算法在仅RGB和RGB-D动作识别方面均以显著优势优于现有方法。
引用
@article{arxiv.1707.00823,
title = {Learning Human Pose Models from Synthesized Data for Robust RGB-D Action Recognition},
author = {Jian Liu and Naveed Akhtar and Ajmal Mian},
journal= {arXiv preprint arXiv:1707.00823},
year = {2018}
}
备注
Revision submitted to IJCV