中文

使用Tacotron2的视听语音合成

音频与语音处理 2021-08-31 v2 计算与语言 声音

摘要

视听语音合成是在最大化声学与视觉语音一致性的同时合成说话人脸的问题。本文提出并比较了两种用于3D人脸模型的视听语音合成系统。第一个系统是AVTacotron2,它是一种基于Tacotron2架构的端到端文本到视听语音合成器。AVTacotron2将表示待合成句子的音素序列转换为声学特征序列及人脸模型相应控制器。输出的声学特征用于条件化WaveRNN以重建语音波形,输出的面部控制器用于生成说话人脸的相应视频。第二个视听语音合成系统是模块化的,其中声学语音由传统Tacotron2从文本合成。重建的声学语音信号随后被用于通过独立训练的音频到面部动画神经网络来驱动人脸模型的面部控制。我们进一步将两种端到端与模块化方法条件化于编码所需韵律以生成情感视听语音的情感嵌入。我们分析两个系统的性能,并使用主观评测测试将其与真实视频比较。端到端与模块化系统能够合成接近类人的视听语音,其平均意见得分(MOS)分别为4.1与3.9,而来自专业录制视频的真实值MOS为4.1。虽然端到端系统给出更好的整体质量,模块化方法更灵活,且声学语音与视觉语音合成的质量几乎彼此独立。

关键词

引用

@article{arxiv.2008.00620,
  title  = {Audiovisual Speech Synthesis using Tacotron2},
  author = {Ahmed Hussen Abdelaziz and Anushree Prasanna Kumar and Chloe Seivwright and Gabriele Fanelli and Justin Binder and Yannis Stylianou and Sachin Kajarekar},
  journal= {arXiv preprint arXiv:2008.00620},
  year   = {2021}
}

备注

This work has been submitted to the 23rd ACM International Conference on Multimodal Interaction for possible publication