AdaSpeech:面向定制语音的自适应文本转语音系统
音频与语音处理
2021-03-02 v1 人工智能
计算与语言
声音
摘要
定制语音是商业语音平台中一种特定的文本转语音(TTS)服务,旨在利用少量语音数据将源 TTS 模型适配到为目标说话人合成个人语音。定制语音对 TTS 适配提出了两个独特挑战:1)为支持多样化客户,适配模型需要处理可能与源语音数据差异很大的多种声学条件;2)为支持大量客户,每个目标说话人的适配参数需要足够小以降低内存占用,同时保持高语音质量。在本工作中,我们提出 AdaSpeech,一种用于高质量、高效定制新语音的自适应 TTS 系统。我们在 AdaSpeech 中设计了若干技术以应对定制语音中的两个挑战:1)为处理不同声学条件,我们在训练时使用两个声学编码器从目标语音中提取句级向量和音素级向量序列;在推理时,我们从参考语音中提取句级向量,并使用声学预测器预测音素级向量。2)为更好地权衡适配参数与语音质量,我们在 AdaSpeech 的 mel 谱解码器中引入条件层归一化,并在适配时除说话人嵌入外微调该部分。我们在 LibriTTS 数据集上预训练源 TTS 模型,并在 VCTK 和 LJSpeech 数据集(声学条件与 LibriTTS 不同)上以少量适配数据(例如 20 句话,约 1 分钟语音)进行微调。实验结果表明,AdaSpeech 以每说话人仅约 5K 的特定参数取得了远优于基线方法的适配质量,证明了其在定制语音上的有效性。音频样本见 https://speechresearch.github.io/adaspeech/。
引用
@article{arxiv.2103.00993,
title = {AdaSpeech: Adaptive Text to Speech for Custom Voice},
author = {Mingjian Chen and Xu Tan and Bohan Li and Yanqing Liu and Tao Qin and Sheng Zhao and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2103.00993},
year = {2021}
}
备注
Accepted by ICLR 2021