中文

基于注意力的端到端语音识别中的说话人自适应

计算与语言 2019-11-12 v1 机器学习 声音 音频与语音处理

摘要

我们提出三种基于正则化的说话人自适应方法,以利用来自目标说话人的极少量自适应数据,使基于注意力的编码器-解码器(AED)模型适应于端到端自动语音识别。第一种方法是 Kullback-Leibler 散度(KLD)正则化,其中通过向自适应准则添加 KLD 正则化,迫使说话人相关(SD)AED 的输出分布接近说话人无关(SI)模型。为补偿 KLD 正则化中的非对称缺陷,提出一种对抗性说话人自适应(ASA)方法,通过对辅助判别器与 SD AED 的对抗学习来正则化 SD AED 的深度特征分布。第三种方法是多任务学习,其中训练 SD AED 联合执行预测大量输出单元的主任务与预测少量输出单元的辅助任务,以缓解目标稀疏问题。在 Microsoft 短消息听写任务上评估,三种方法在自适应 AED 模型上均高度有效,相较于由 3400 小时数据训练的 SI AED,在有监督与无监督自适应下分别实现了高达 12.2% 与 3.0% 的词错误率改善。

关键词

引用

@article{arxiv.1911.03762,
  title  = {Speaker Adaptation for Attention-Based End-to-End Speech Recognition},
  author = {Zhong Meng and Yashesh Gaur and Jinyu Li and Yifan Gong},
  journal= {arXiv preprint arXiv:1911.03762},
  year   = {2019}
}

备注

5 pages, 3 figures, Interspeech 2019