中文

端到端CTC模型的说话人自适应

计算与语言 2019-01-07 v1

摘要

我们提出两种用于端到端(E2E)自动语音识别系统说话人自适应的方法。一种是Kullback-Leibler散度(KLD)正则化,另一种是多任务学习(MTL)。两种方法均旨在解决E2E系统中说话人自适应的数据稀疏性尤其是输出目标稀疏性问题。KLD正则化通过迫使自适应模型的输出分布接近未自适应模型来适配模型。MTL利用联合训练的辅助任务来提升主任务的性能。我们在具有三种不同类型输出单元的E2E连接时序分类(CTC)模型上研究了我们的方法。在Microsoft短消息听写任务上的实验表明,MTL优于KLD正则化。具体而言,对于词CTC模型,MTL自适应在有监督和无监督自适应下分别获得8.8%和4.0%的相对词错误率降低(WERRs);对于混合单元CTC模型,分别获得9.6%和3.8%的相对WERRs。

关键词

引用

@article{arxiv.1901.01239,
  title  = {Speaker Adaptation for End-to-End CTC Models},
  author = {Ke Li and Jinyu Li and Yong Zhao and Kshitiz Kumar and Yifan Gong},
  journal= {arXiv preprint arXiv:1901.01239},
  year   = {2019}
}

备注

published at IEEE Workshop of Spoken Language Technology