从语音预测手势参数的可预测性及其感知重要性研究
人机交互
2020-10-05 v1 计算机视觉与模式识别
机器学习
摘要
手势行为是人类对话的自然组成部分。许多工作致力于通过设计语音驱动的手势生成器来消除创建具身对话智能体时繁琐的手工动画需求。然而,这些生成器常以黑盒方式工作,假定输入语音与输出运动间存在普遍关系。由于其成功仍然有限,我们更详细地探究语音如何与手势运动的不同方面相关联。我们确定了表征手势的若干参数,如速度与手势幅度,并以双重方式探究它们与语音信号的关系。首先,我们训练多个循环网络从语音预测手势参数,以理解手势属性仅从语音建模的效果。我们发现手势参数可从语音部分预测,且某些参数(如路径长度)比其它参数(如速度)预测更准确。其次,我们设计了一项感知研究,以评估每个手势参数对于生成被人们视为适合该语音的运动的重要性。结果表明,任何参数的退化都被负面看待,但某些变化(如手形)比其它变化影响更大。视频摘要见 https://youtu.be/aw6-_5kmLjY。
引用
@article{arxiv.2010.00995,
title = {Understanding the Predictability of Gesture Parameters from Speech and their Perceptual Importance},
author = {Ylva Ferstl and Michael Neff and Rachel McDonnell},
journal= {arXiv preprint arXiv:2010.00995},
year = {2020}
}
备注
To be published in the Proceedings of the 20th ACM International Conference on Intelligent Virtual Agents (IVA 20)