Body2Hands:从对话手势身体动态学习推断三维手部姿态
计算机视觉与模式识别
2021-04-08 v3
摘要
我们提出了一种新颖的、用于对话手势领域三维手部形状合成与估计的身体运动学习深度先验。我们的模型基于这样一个见解:在非语言交流环境中,身体运动与手势之间存在强相关性。我们将此先验的学习形式化为一个仅给定身体运动输入,预测随时间变化的三维手部形状的任务。利用从大规模互联网视频数据集中获得的三维姿态估计进行训练,我们的手部预测模型仅凭说话者手臂的三维运动作为输入,就能生成令人信服的三维手势。我们证明了该方法在基于身体运动输入的手势合成,以及作为基于单视角图像的三维手部姿态估计的强大身体先验方面的有效性。我们证明,我们的方法优于以往最先进的方法,并且能够泛化到基于独白训练数据之外的多对多对话场景。视频结果可在 http://people.eecs.berkeley.edu/~evonne_ng/projects/body2hands/ 查看。
引用
@article{arxiv.2007.12287,
title = {Body2Hands: Learning to Infer 3D Hands from Conversational Gesture Body Dynamics},
author = {Evonne Ng and Shiry Ginosar and Trevor Darrell and Hanbyul Joo},
journal= {arXiv preprint arXiv:2007.12287},
year = {2021}
}