基于文本、音频与说话人身份三模态语境的语音手势生成
图形学
2020-09-07 v1 计算机视觉与模式识别
人机交互
摘要
对于类人智能体,包括虚拟化身和社交机器人,在说话时做出恰当手势对于人—智能体交互至关重要。伴语手势提升交互体验并使智能体显得生动。然而,由于缺乏对人类如何做手势的理解,生成类人手势十分困难。数据驱动方法试图从人类示范中学习手势技能,但手势的模糊性和个体性阻碍了学习。在本文中,我们提出一种自动手势生成模型,利用语音文本、音频和说话人身份的多模态语境可靠地生成手势。通过结合多模态语境与对抗训练方案,所提模型输出的手势类人且与语音内容和节奏匹配。我们还引入了一种用于手势生成模型的新定量评价指标。采用所引入指标和主观人类评价的试验表明,所提手势生成模型优于现有端到端生成模型。我们进一步确认,在语境受限的场景下我们的模型能够配合合成音频工作,并展示通过指定在从各类说话人视频中学得的风格嵌入空间中不同的说话人身份,可为同一语音生成不同手势风格。所有代码与数据可在 https://github.com/ai4r/Gesture-Generation-from-Trimodal-Context 获取。
引用
@article{arxiv.2009.02119,
title = {Speech Gesture Generation from the Trimodal Context of Text, Audio, and Speaker Identity},
author = {Youngwoo Yoon and Bok Cha and Joo-Haeng Lee and Minsu Jang and Jaeyeon Lee and Jaehong Kim and Geehyuk Lee},
journal= {arXiv preprint arXiv:2009.02119},
year = {2020}
}
备注
16 pages; ACM Transactions on Graphics (SIGGRAPH Asia 2020)