中文

用于基于DNN的多说话人语音合成的说话人验证衍生损失与数据增强

音频与语音处理 2021-06-04 v1 声音

摘要

构建基于多说话人神经网络的声音到语音(text-to-speech)合成系统通常依赖于每个说话人大量高质量录音的可用性,并在训练过程中以说话人身份或其学习到的表示作为条件。然而,当每个说话人可用数据较少或说话人数量有限时,多说话人TTS难以训练,并导致说话人相似度和自然度较差。为解决此问题,我们探索了两个方向:通过附加损失项迫使网络学习更好的说话人身份表示;以及利用波形操控方法增强每个说话人对应的输入数据。我们表明,在使用客观和主观指标评估时,两种方法均有效。附加损失项有助于说话人相似度,而数据增强改善了多说话人TTS系统的可懂度。

关键词

引用

@article{arxiv.2106.01789,
  title  = {Speaker verification-derived loss and data augmentation for DNN-based multispeaker speech synthesis},
  author = {Beata Lorincz and Adriana Stan and Mircea Giurgiu},
  journal= {arXiv preprint arXiv:2106.01789},
  year   = {2021}
}

备注

Accepted at EUSIPCO 2021