用于基于DNN的多说话人语音合成的说话人验证衍生损失与数据增强
音频与语音处理
2021-06-04 v1 声音
摘要
构建基于多说话人神经网络的声音到语音(text-to-speech)合成系统通常依赖于每个说话人大量高质量录音的可用性,并在训练过程中以说话人身份或其学习到的表示作为条件。然而,当每个说话人可用数据较少或说话人数量有限时,多说话人TTS难以训练,并导致说话人相似度和自然度较差。为解决此问题,我们探索了两个方向:通过附加损失项迫使网络学习更好的说话人身份表示;以及利用波形操控方法增强每个说话人对应的输入数据。我们表明,在使用客观和主观指标评估时,两种方法均有效。附加损失项有助于说话人相似度,而数据增强改善了多说话人TTS系统的可懂度。
引用
@article{arxiv.2106.01789,
title = {Speaker verification-derived loss and data augmentation for DNN-based multispeaker speech synthesis},
author = {Beata Lorincz and Adriana Stan and Mircea Giurgiu},
journal= {arXiv preprint arXiv:2106.01789},
year = {2021}
}
备注
Accepted at EUSIPCO 2021