利用语言学先验从视频重建手语虚拟形象
计算机视觉与模式识别
2023-04-21 v1 图形学
摘要
手语(SL)是全球约7000万聋人的主要交流方式。孤立手势的视频词典是手语学习的核心工具。用3D虚拟形象替代这些视频有助于学习并支持AR/VR应用,从而改善对技术与在线媒体的可及性。然而,极少有研究尝试从手语视频中估计富有表现力的3D虚拟形象;遮挡、噪声与运动模糊使该任务十分困难。为此,我们引入了适用于所有手语且具有普遍性的新颖语言学先验,其对3D手部姿态提供约束,有助于消解孤立手势中的歧义。我们的方法SGNify可从野外单目手语视频中全自动捕获细粒度手部姿态、面部表情与身体运动。我们使用商用动作捕捉系统计算与单目视频同步的3D虚拟形象,从而对SGNify进行定量评估。在手语视频上,SGNify优于最先进的3D身体姿态与形状估计方法。一项感知研究表明,SGNify的3D重建比以往方法显著更易理解且更自然,并与源视频相当。代码与数据见 。
引用
@article{arxiv.2304.10482,
title = {Reconstructing Signing Avatars From Video Using Linguistic Priors},
author = {Maria-Paola Forte and Peter Kulits and Chun-Hao Huang and Vasileios Choutas and Dimitrios Tzionas and Katherine J. Kuchenbecker and Michael J. Black},
journal= {arXiv preprint arXiv:2304.10482},
year = {2023}
}