中文

从Senone到Chenone:用于混合语音识别的绑定上下文相关字素

音频与语音处理 2019-10-15 v2 机器学习 声音 机器学习

摘要

有一种隐含假设认为,传统的混合自动语音识别(ASR)方法无法直接建模字素,而需要依赖语音词典才能获得有竞争力的性能,尤其是在字素-音素对应较差的英语上。在本工作中,我们首次表明,在英语上,混合ASR系统实际上可以通过利用绑定的上下文相关字素(即chenone)来有效地建模字素。我们的基于chenone的系统在三个不同的英语数据集上相对等效的senone基线取得了4.5%至11.1%的显著改进。我们在Librispeech上的结果相对于其他混合方法达到了state-of-the-art,并与先前发布的端到端结果具有竞争力。进一步分析表明,chenone能更好地利用强大的声学模型和大规模训练数据,并且需要上下文和位置相关的建模才能良好工作。基于chenone的系统在专有名词和罕见词识别上也优于senone基线,而后者传统上被认为在该领域具有优势。我们的工作为端到端ASR提供了一种替代方案,并确立了混合系统可以通过放弃对语音知识的依赖而得到改进。

关键词

引用

@article{arxiv.1910.01493,
  title  = {From Senones to Chenones: Tied Context-Dependent Graphemes for Hybrid Speech Recognition},
  author = {Duc Le and Xiaohui Zhang and Weiyi Zheng and Christian Fügen and Geoffrey Zweig and Michael L. Seltzer},
  journal= {arXiv preprint arXiv:1910.01493},
  year   = {2019}
}

备注

To appear at ASRU 2019