AdaSpeech 2:基于无转录数据的自适应语音合成
声音
2021-04-21 v1 计算与语言
音频与语音处理
摘要
语音合成(TTS)被广泛用于为目标说话人合成个人语音,其中训练良好的源 TTS 模型利用该目标说话人的少量配对自适应数据(语音及其文本转录)进行微调。然而,在许多场景中,仅有无转录的语音数据可用于自适应,这给此前的 TTS 自适应流程(如 AdaSpeech)带来挑战。本文中,我们开发了 AdaSpeech 2,一种仅利用无转录语音数据进行自适应的自适应 TTS 系统。具体而言,我们向训练良好的 TTS 模型引入一个梅尔谱编码器以进行语音重构,同时约束梅尔谱编码器的输出序列接近原始音素编码器的输出序列。在自适应阶段,我们使用无转录语音数据进行语音重构,并仅微调 TTS 解码器。AdaSpeech 2 具有两点优势:1)可插拔:我们的系统无需重新训练即可轻松应用于现有训练好的 TTS 模型。2)有效:在相同数量无转录数据下,我们的系统达到与有转录 TTS 自适应(如 AdaSpeech)相当的语音质量,且语音质量优于此前的无转录自适应方法。合成语音样本见 https://speechresearch.github.io/adaspeech2/。
引用
@article{arxiv.2104.09715,
title = {AdaSpeech 2: Adaptive Text to Speech with Untranscribed Data},
author = {Yuzi Yan and Xu Tan and Bohan Li and Tao Qin and Sheng Zhao and Yuan Shen and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2104.09715},
year = {2021}
}
备注
Accepted by ICASSP 2021