通过非言语图灵测试:评估由语音生成的姿态动画
计算机视觉与模式识别
2021-08-24 v2
摘要
人们使用语音以及手势、面部表情或身体姿态等非言语信号进行交流。非言语信号以大量方式影响口语话语的含义。非言语信号的缺失使交流过程变得贫乏。然而,当用户以虚拟形象表示时,若无专门的动作捕捉硬件,很难将非言语信号与语音一同转换至虚拟世界。本文中,我们提出一种新颖的、数据驱动的从语音直接生成手势的技术。我们的方法基于将生成对抗神经网络(GANs)应用于建模语音与手势之间的相关性而非因果性。该方法近似了关于非言语交流与语音如何相关的神经科学发现。我们创建了一个大型数据集,其由语音及对应的 3D 人体姿态格式手势组成,我们的模型从中学习说话人特定的相关性。我们在一个受图灵测试启发的用户研究中评估所提出的技术。研究中,我们将生成的手势在虚拟角色上动画化。我们发现用户无法区分生成的手势与记录的手势。此外,用户能够识别我们合成的手势是否与给定话语相关或不相关。代码与视频可在 https://github.com/mrebol/Gestures-From-Speech 获取。
引用
@article{arxiv.2107.00712,
title = {Passing a Non-verbal Turing Test: Evaluating Gesture Animations Generated from Speech},
author = {Manuel Rebol and Christian Gütl and Krzysztof Pietroszek},
journal= {arXiv preprint arXiv:2107.00712},
year = {2021}
}