语音驱动手势生成的输入与输出表示分析
人机交互
2019-06-12 v4
摘要
本文提出了一种用于自动语音驱动手势生成的新颖框架,适用于包括虚拟代理和机器人在内的人机交互。具体而言,我们通过引入表示学习,扩展了近期基于深度学习与数据驱动的语音驱动手势生成方法。我们的模型以语音作为输入,并以 3D 坐标序列的形式输出手势。该方法包含两个步骤。首先,我们使用由运动编码器 MotionE 和运动解码器 MotionD 组成的去噪自编码器神经网络,学习人体运动的低维表示。所学到的表示在去除无关变化的同时,保留了人体姿态变化中最重要的方面。其次,我们训练了一种新颖的编码器网络 SpeechE,将语音映射到降维后的对应运动表示。在测试阶段,语音编码器和运动解码器网络被组合使用:SpeechE 根据给定的语音信号预测运动表示,随后 MotionD 将这些表示解码以生成运动序列。我们评估了不同的表示尺寸,以找到最有效的表示维度。我们还评估了使用不同语音特征作为模型输入的效果。我们发现,mel 频率倒谱系数 (MFCCs) 单独使用或与韵律特征结合使用时表现最佳。后续用户研究的结果证实了表示学习的优势。
引用
@article{arxiv.1903.03369,
title = {Analyzing Input and Output Representations for Speech-Driven Gesture Generation},
author = {Taras Kucherenko and Dai Hasegawa and Gustav Eje Henter and Naoshi Kaneko and Hedvig Kjellström},
journal= {arXiv preprint arXiv:1903.03369},
year = {2019}
}
备注
Accepted at IVA '19. Shorter version published at AAMAS '19. The code is available at https://github.com/GestureGeneration/Speech_driven_gesture_generation_with_autoencoder