基于对抗特征学习与无监督聚类的含声学及文本噪声发现数据的语音合成
声音
2020-10-28 v1 机器学习
音频与语音处理
摘要
基于注意力的序列到序列(seq2seq)语音合成已取得卓越性能。但训练此类seq2seq系统需要带人工转写的录音室质量语料库。本文提出一种利用极具挑战性的发现数据构建高质量且稳定的基于seq2seq的语音合成系统的方法,其中训练语音包含噪声干扰(声学噪声),文本为不完美的语音识别转写(文本噪声)。为处理文本侧噪声,我们提出一种基于VQVAE的启发式方法,用直接从语音中学到的音素信息补偿错误的语言特征。对于语音侧噪声,我们提出通过对抗训练与数据增强在自回归解码器中学习噪声无关特征,无需额外的语音增强模型。实验显示了所提方法在处理文本侧与语音侧噪声上的有效性。超越基于最先进语音增强模型的去噪方法,我们基于含噪发现数据构建的系统可合成干净且高质量的语音,其MOS接近于基于干净对应数据构建的系统。
引用
@article{arxiv.2004.13595,
title = {Adversarial Feature Learning and Unsupervised Clustering based Speech Synthesis for Found Data with Acoustic and Textual Noise},
author = {Shan Yang and Yuxuan Wang and Lei Xie},
journal= {arXiv preprint arXiv:2004.13595},
year = {2020}
}
备注
submitted to IEEE SPL