从Senone到Chenone:用于混合语音识别的绑定上下文相关字素
音频与语音处理
2019-10-15 v2 机器学习
声音
机器学习
摘要
有一种隐含假设认为,传统的混合自动语音识别(ASR)方法无法直接建模字素,而需要依赖语音词典才能获得有竞争力的性能,尤其是在字素-音素对应较差的英语上。在本工作中,我们首次表明,在英语上,混合ASR系统实际上可以通过利用绑定的上下文相关字素(即chenone)来有效地建模字素。我们的基于chenone的系统在三个不同的英语数据集上相对等效的senone基线取得了4.5%至11.1%的显著改进。我们在Librispeech上的结果相对于其他混合方法达到了state-of-the-art,并与先前发布的端到端结果具有竞争力。进一步分析表明,chenone能更好地利用强大的声学模型和大规模训练数据,并且需要上下文和位置相关的建模才能良好工作。基于chenone的系统在专有名词和罕见词识别上也优于senone基线,而后者传统上被认为在该领域具有优势。我们的工作为端到端ASR提供了一种替代方案,并确立了混合系统可以通过放弃对语音知识的依赖而得到改进。
引用
@article{arxiv.1910.01493,
title = {From Senones to Chenones: Tied Context-Dependent Graphemes for Hybrid Speech Recognition},
author = {Duc Le and Xiaohui Zhang and Weiyi Zheng and Christian Fügen and Geoffrey Zweig and Michael L. Seltzer},
journal= {arXiv preprint arXiv:1910.01493},
year = {2019}
}
备注
To appear at ASRU 2019