利用合成数据弥补联合多模态语音与手势合成中的数据不足
人机交互
2024-05-01 v1 计算机视觉与模式识别
图形学
声音
音频与语音处理
摘要
尽管人类在面对面交谈时同时进行口语和非口语表达,但用于从文本生成语音音频和同步 3D 手势运动的联合统一合成方法尚处于新兴领域。这些技术具有巨大的发展潜力,可实现更加人性化、高效、表达丰富且稳健的合成通信,但目前因缺乏合适的大规模数据集而受限,因为现有方法是在来自所有组成模态的平行数据上进行训练的。鼓作学生-教师方法的灵感,我们提出了简单解决数据不足的方案,即仅合成额外的训练材料。具体而言,我们使用在大规模数据集上训练的单模态合成模型来创建多模态(但合成的)平行训练数据,然后在该数据上预训练联合合成模型。此外,我们提出了一种新的合成架构,将更好的和更可控的韵律建模添加到该领域的最新方法中。我们的结果确认,预训练大量合成数据可提高联合多模态模型合成语音和运动的质量,而采用我们提出的架构在预训练合成数据方面还能获得进一步的好处。参见 https://shivammehta25.github.io/MAGI/ 查看示例输出。
引用
@article{arxiv.2404.19622,
title = {Fake it to make it: Using synthetic data to remedy the data shortage in joint multimodal speech-and-gesture synthesis},
author = {Shivam Mehta and Anna Deichler and Jim O'Regan and Birger Moëll and Jonas Beskow and Gustav Eje Henter and Simon Alexanderson},
journal= {arXiv preprint arXiv:2404.19622},
year = {2024}
}
备注
13+1 pages, 2 figures, accepted at the Human Motion Generation workshop (HuMoGen) at CVPR 2024