中文

音频即一切:基于 WavLM 预训练模型的语音驱动手势合成

声音 2024-04-16 v3 人工智能 图形学 多媒体 音频与语音处理

摘要

数字人协同语音手势的生成是虚拟人创建领域的一个新兴方向。先前的研究通过使用声学与语义信息作为输入,并采用分类方法识别人物 ID 与情绪来驱动协同语音手势生成,已取得了一定进展。然而,这一尝试仍面临显著挑战。这些挑战不仅在于协同语音手势、语音声学及语义之间的复杂相互作用,还涉及与个性、情绪以及其他隐晦但重要因素相关的复杂性。本文提出“diffmotion-v2”,一种基于语音条件扩散且基于非自回归 transformer 的生成模型,并采用 WavLM 预训练模型。它仅使用原始语音音频即可生成个性化且风格化的全身协同语音手势,无需复杂的多模态处理与人工标注。首先,考虑到语音音频不仅包含声学与语义特征,还传达个性特质、情绪及与伴随手势相关的更细微信息,我们开创性地将大规模预训练模型 WavLM 适配用于提取低层与高层音频信息。其次,我们在基于 transformer 的层中引入自适应层归一化架构,以学习语音信息与伴随手势之间的关系。在 Trinity、ZEGGS 与 BEAT 数据集上进行了广泛的主观评测实验,以验证 WavLM 及该模型合成具有多种风格的自然协同语音手势的能力。

关键词

引用

@article{arxiv.2308.05995,
  title  = {Audio is all in one: speech-driven gesture synthetics using WavLM pre-trained model},
  author = {Fan Zhang and Naye Ji and Fuxing Gao and Siyuan Zhao and Zhaohan Wang and Shunman Li},
  journal= {arXiv preprint arXiv:2308.05995},
  year   = {2024}
}

备注

This article needs major revision