基于 DNN 声学模型的说话人自适应实证评估
声音
2019-01-01 v3 计算与语言
音频与语音处理
摘要
说话人自适应旨在从非特定人声学模型中估计特定人声学模型,以最小化由说话人变异性引起的训练和测试条件之间的失配。自从深度学习模型成为主流以来,已经提出了多种神经网络自适应方法。但是仍然缺乏不同方法之间的实验比较,特别是当基于 DNN 的声学模型已经取得巨大进步时。在本文中,我们旨在通过提供三种典型说话人自适应方法:LIN、LHUC 和 KLD 的实证评估来填补这一空白。我们在一个强大的 TDNN-LSTM 声学模型上进行了使用不同自适应数据量的自适应实验。更具挑战性的是,这里我们所关注的源和目标是标准普通话说话人模型和带口音的普通话说话人模型。我们比较了不同方法及其组合的性能。还通过说话人的口音程度检验了说话人自适应的性能。
引用
@article{arxiv.1803.10146,
title = {Empirical Evaluation of Speaker Adaptation on DNN based Acoustic Model},
author = {Ke Wang and Junbo Zhang and Yujun Wang and Lei Xie},
journal= {arXiv preprint arXiv:1803.10146},
year = {2019}
}
备注
Interspeech 2018