基于语音的自由形态身体动作生成
计算机视觉与模式识别
2022-03-07 v1 声音
音频与语音处理
摘要
人们在演讲时会自然地进行自发的身体动作以增强表达。由于从语音到身体动作是非确定性的映射,从语音生成身体动作 inherently 十分困难。大多数现有工作通过以某些风格为条件,以确定性方式将语音映射为动作,导致次优结果。受语言学研究的启发,我们将协同语音动作分解为两个互补部分:姿态模式与节奏动态。相应地,我们引入一种新颖的自由形态动作生成模型(FreeMo),采用双流架构,即用于主要姿态生成的姿态模式分支,以及用于节奏动态合成的节奏动作分支。一方面,多样的姿态模式通过在潜空间中由语音语义引导的条件采样生成。另一方面,节奏动态与语音韵律同步。大量实验证明了相较于若干基线方法在动作多样性、质量及与语音同步性方面的优越性能。代码与预训练模型将通过 https://github.com/TheTempAccount/Co-Speech-Motion-Generation 公开提供。
引用
@article{arxiv.2203.02291,
title = {Freeform Body Motion Generation from Speech},
author = {Jing Xu and Wei Zhang and Yalong Bai and Qibin Sun and Tao Mei},
journal= {arXiv preprint arXiv:2203.02291},
year = {2022}
}