从单张彩色图像学习估计三维人体姿态与形状
计算机视觉与模式识别
2018-05-11 v1
摘要
本工作解决从单张彩色图像估计全身三维人体姿态与形状的问题。这是一项通常基于迭代优化的方法占优、而卷积网络(ConvNets)因缺乏训练数据及三维预测分辨率低而表现不佳的任务。我们的工作旨在弥合这一差距,并提出一种基于 ConvNets 的高效直接预测方法。我们方法的核心是在端到端框架中引入参数化统计体型模型(SMPL)。这使我们能获得非常精细的三维网格结果,同时仅需估计少量参数,便于网络直接预测。有趣的是,我们证明这些参数仅从二维关键点与掩码即可可靠预测。这些是通用二维人体分析 ConvNets 的典型输出,使我们得以放宽对带有三维形状真值图像用于训练的庞大需求。同时,通过保持可微性,在训练时我们根据估计参数生成三维网格,并使用三维逐顶点损失对表面显式优化。最后,采用可微渲染器将三维网格投影至图像,从而通过优化投影与二维标注(即二维关键点或掩码)的一致性,进一步精炼网络。所提方法在此任务上优于先前基线,并为从单张彩色图像直接预测三维形状提供了有吸引力的方案。
引用
@article{arxiv.1805.04092,
title = {Learning to Estimate 3D Human Pose and Shape from a Single Color Image},
author = {Georgios Pavlakos and Luyang Zhu and Xiaowei Zhou and Kostas Daniilidis},
journal= {arXiv preprint arXiv:1805.04092},
year = {2018}
}
备注
CVPR 2018 Camera Ready