数字爱因斯坦体验:面向对话式 AI 的快速文本转语音
音频与语音处理
2021-07-23 v1 人工智能
计算与语言
机器学习
声音
摘要
我们描述了为一种对话式 AI 用例创建并交付定制语音的方法。更具体地,我们为数字爱因斯坦角色提供语音,以在数字对话体验中实现人机交互。为创建契合语境的语音,我们首先设计语音角色并录制符合期望语音属性的音频。随后我们对语音进行建模。我们的方案利用 Fastspeech 2 从音素预测对数刻度的 mel 谱图,并使用 Parallel WaveGAN 生成波形。系统支持字符输入并输出语音波形。我们对选定词使用自定义词典以确保其正确发音。我们提出的云架构实现了快速语音交付,使得实时与阿尔伯特·爱因斯坦的数字版本对话成为可能。
引用
@article{arxiv.2107.10658,
title = {Digital Einstein Experience: Fast Text-to-Speech for Conversational AI},
author = {Joanna Rownicka and Kilian Sprenkamp and Antonio Tripiana and Volodymyr Gromoglasov and Timo P Kunz},
journal= {arXiv preprint arXiv:2107.10658},
year = {2021}
}
备注
accepted at Interspeech 2021