基于改进CNN监督的野外单目三维人体姿态估计
计算机视觉与模式识别
2017-10-05 v5
摘要
我们提出了一种基于卷积神经网络(CNN)的方法,用于从单张RGB图像进行三维人体姿态估计,旨在解决仅依赖极其有限的公开三维姿态数据训练的模型泛化能力不足的问题。仅使用现有的三维姿态数据和二维姿态数据,我们通过迁移学习到的特征,在既定基准上展示了最先进的性能,同时也能泛化到野外场景。我们进一步引入了一个新的训练集,用于从真实人物的单目图像进行人体姿态估计,其真实值由多相机无标记运动捕捉系统采集。该数据集在姿态、人体外观、服装、遮挡和视角方面具有更大的多样性,补充了现有语料库,并扩大了数据增强的范围。我们还贡献了一个涵盖室外和室内场景的新基准,并证明我们的三维姿态数据集相比现有标注数据展现出更好的野外性能,结合二维姿态数据的迁移学习后,性能得到进一步提升。总而言之,我们认为,将表征迁移学习与算法和数据贡献相结合,对于通用的三维人体姿态估计至关重要。
引用
@article{arxiv.1611.09813,
title = {Monocular 3D Human Pose Estimation In The Wild Using Improved CNN Supervision},
author = {Dushyant Mehta and Helge Rhodin and Dan Casas and Pascal Fua and Oleksandr Sotnychenko and Weipeng Xu and Christian Theobalt},
journal= {arXiv preprint arXiv:1611.09813},
year = {2017}
}
备注
Accepted at the International Conference on 3D Vision (3DV) 2017