基于进化训练数据的级联深度单目三维人体姿态估计
计算机视觉与模式识别
2021-04-12 v3 机器学习
图像与视频处理
摘要
端到端的深度表示学习在单目三维人体姿态估计中取得了显著的精度,然而,这些模型可能会因训练数据有限且固定而无法处理未见过的姿态。本文提出了一种新颖的数据增强方法,该方法:(1) 可扩展地合成海量训练数据(超过800万个有效的三维人体姿态及其对应的二维投影),用于训练二维到三维网络;(2) 能有效减少数据集偏差。我们的方法基于分层人体表示和受先验知识启发的启发式规则,进化有限的数据集以合成未见过的三维人体骨架。大量实验表明,我们的方法不仅在最大的公开基准上达到了最优精度,而且对未见过的和罕见的姿态具有显著更好的泛化能力。代码、预训练模型和工具可在本 HTTPS URL 获取。
引用
@article{arxiv.2006.07778,
title = {Cascaded deep monocular 3D human pose estimation with evolutionary training data},
author = {Shichao Li and Lei Ke and Kevin Pratama and Yu-Wing Tai and Chi-Keung Tang and Kwang-Ting Cheng},
journal= {arXiv preprint arXiv:2006.07778},
year = {2021}
}
备注
Accepted to CVPR 2020 as Oral Presentation