含噪声训练数据下基于神经网络的语音转换算法中元音与韵律的贡献
音频与语音处理
2020-03-11 v1
摘要
本研究提出了一种基于神经网络的语音转换(VC)模型。尽管众所周知浊音与韵律是语音转换框架中最重要的组成部分,但未知的是它们在有噪声和不受控环境中的客观贡献。该模型使用 2 层前馈神经网络将源说话人的线性预测分析系数映射到目标说话人的声学向量空间,以客观确定声音的浊音、清音和超音段成分对语音转换模型的贡献。结果表明,元音 'a'、'i'、'o' 在转换成功中具有最显著的贡献。还发现清音受噪声训练数据影响最严重。相对于浊音,高于噪声基底平均 40 dB 的噪声水平使语音转换成功率降低了 55.14%。结果还显示,对于跨性别语音转换,当目标说话人为女性时韵律转换更为显著。
引用
@article{arxiv.2003.04640,
title = {Vowels and Prosody Contribution in Neural Network Based Voice Conversion Algorithm with Noisy Training Data},
author = {Olaide Agbolade},
journal= {arXiv preprint arXiv:2003.04640},
year = {2020}
}
备注
5 pages