听、注意、拼写与自适应:说话人自适应的序列到序列语音识别
音频与语音处理
2019-07-12 v1 计算与语言
机器学习
声音
机器学习
摘要
基于序列到序列(seq2seq)的 ASR 系统已展现出最先进的性能,同时在简洁性方面具有明显优势。然而,相关比较大多在说话人无关(SI)的 ASR 系统上进行,尽管在实践中通常使用说话人自适应的传统系统以提高对说话人和环境变化的鲁棒性。本文中,我们将说话人自适应应用于 seq2seq 模型,目标是匹配传统 ASR 自适应的性能。具体而言,我们研究了基于 Kullback-Leibler 散度(KLD)以及线性隐网络(LHN)的 seq2seq ASR 自适应,每位说话人使用不同量的(最多 20 小时)自适应数据。我们的 SI 模型在大量听写数据上训练并达到了最先进的结果。通过 seq2seq 模型的 KLD 自适应,我们获得了 25% 的相对词错误率(WER)提升,而传统系统中声学模型自适应仅带来 18.7% 的提升。我们还表明 seq2seq 模型的 WER 随自适应数据量呈对数线性下降。最后,我们基于最小 WER 准则分析自适应,并将语言模型(LM)与说话人自适应的 seq2seq 模型进行分数融合,从而进一步提升了 seq2seq 系统的性能。
引用
@article{arxiv.1907.04916,
title = {Listen, Attend, Spell and Adapt: Speaker Adapted Sequence-to-Sequence ASR},
author = {Felix Weninger and Jesús Andrés-Ferrer and Xinwei Li and Puming Zhan},
journal= {arXiv preprint arXiv:1907.04916},
year = {2019}
}
备注
To appear in INTERSPEECH 2019