中文

基于 CTC 声学模型的多语言训练与跨语言自适应

音频与语音处理 2018-01-24 v2 声音

摘要

用于自动语音识别(ASR)的多语言模型颇具吸引力,因为已证明它们可从更多训练数据中获益,且更易于自适应至资源不足的语言。然而,从单语言上下文相关模型初始化会导致上下文相关状态数量的激增。连接主义时序分类(CTC)是一种潜在的解决方案,因为它在使用单音素标签时表现良好。我们在自适应与正则化技术的背景下研究多语言 CTC,这些技术已在更常规的语境中被证明有益。该多语言模型使用 CTC 损失函数训练以建模基于通用国际音标(IPA)的音素集。研究了学习隐单元贡献(LHUC)以执行语言自适应训练。此外,还研究并测试了跨语言自适应过程中的 dropout,以缓解过拟合问题。实验表明,通用基于音素的 CTC 系统性能可通过应用 LHUC 得到提升,并且它可在跨语言自适应过程中扩展至新音素。更新所有参数在有限数据上显示出一致的改进。在自适应过程中应用 dropout 可进一步改进系统,并在有限数据上取得与深度神经网络/隐马尔可夫模型(DNN/HMM)系统相竞争的性能。

关键词

引用

@article{arxiv.1711.10025,
  title  = {Multilingual Training and Cross-lingual Adaptation on CTC-based Acoustic Model},
  author = {Sibo Tong and Philip N. Garner and Hervé Bourlard},
  journal= {arXiv preprint arXiv:1711.10025},
  year   = {2018}
}