中文

利用多任务学习提升声学到词模型与传统混合模型的性能

音频与语音处理 2019-05-17 v2 计算与语言 机器学习 声音

摘要

声学到词(A2W)模型允许从声学信号到词序列的直接映射,因其简洁性而成为端到端自动语音识别的一种引人关注的方法。然而,先前的研究表明,对 A2W 建模通常会遇到数据稀疏问题,从而阻碍直接训练此类模型。迄今为止,预训练初始化是应对该问题的唯一已提出方法。在本工作中,我们提出构建共享神经网络并以多任务方式优化 A2W 与传统混合模型。我们的结果表明,使用我们的多任务模型无需预训练初始化即可使 A2W 模型的训练更加稳定,并且相较于基线模型取得了显著改进。实验还揭示,当与诸如声学到词这样的序列级优化准则联合训练时,混合声学模型的性能可得到进一步提升。

关键词

引用

@article{arxiv.1902.01951,
  title  = {Using multi-task learning to improve the performance of acoustic-to-word and conventional hybrid models},
  author = {Thai-Son Nguyen and Sebastian Stueker and Alex Waibel},
  journal= {arXiv preprint arXiv:1902.01951},
  year   = {2019}
}

备注

submitted newer work which includes this paper results