中文

数字爱因斯坦体验:面向对话式 AI 的快速文本转语音

音频与语音处理 2021-07-23 v1 人工智能 计算与语言 机器学习 声音

摘要

我们描述了为一种对话式 AI 用例创建并交付定制语音的方法。更具体地,我们为数字爱因斯坦角色提供语音,以在数字对话体验中实现人机交互。为创建契合语境的语音,我们首先设计语音角色并录制符合期望语音属性的音频。随后我们对语音进行建模。我们的方案利用 Fastspeech 2 从音素预测对数刻度的 mel 谱图,并使用 Parallel WaveGAN 生成波形。系统支持字符输入并输出语音波形。我们对选定词使用自定义词典以确保其正确发音。我们提出的云架构实现了快速语音交付,使得实时与阿尔伯特·爱因斯坦的数字版本对话成为可能。

关键词

引用

@article{arxiv.2107.10658,
  title  = {Digital Einstein Experience: Fast Text-to-Speech for Conversational AI},
  author = {Joanna Rownicka and Kilian Sprenkamp and Antonio Tripiana and Volodymyr Gromoglasov and Timo P Kunz},
  journal= {arXiv preprint arXiv:2107.10658},
  year   = {2021}
}

备注

accepted at Interspeech 2021