中文

兼得二者之长:用于语音识别的两遍混合与端到端级联框架

计算与语言 2022-02-23 v2 声音 音频与语音处理

摘要

混合系统与端到端(E2E)系统各有优势,其语音识别结果具有不同错误模式。通过联合建模音频与文本,E2E模型在匹配场景下表现更优,并能随大量音频-文本配对训练数据良好扩展。模块化的混合模型更易于定制,且更善于利用海量无配对文本数据。本文提出一种两遍混合与端到端级联(HEC)框架,将混合模型与E2E模型结合以兼取双方之长:第一遍用混合模型,第二遍用E2E模型。我们表明,相较于各自独立系统,所提系统实现了8-10%的相对词错误率降低。更重要的是,与纯E2E系统相比,我们所提系统有望保留混合系统的优势,例如定制与分割能力。我们还表明HEC中的第二遍E2E模型对第一遍混合模型的变化具有鲁棒性。

关键词

引用

@article{arxiv.2110.04891,
  title  = {Have best of both worlds: two-pass hybrid and E2E cascading framework for speech recognition},
  author = {Guoli Ye and Vadim Mazalov and Jinyu Li and Yifan Gong},
  journal= {arXiv preprint arXiv:2110.04891},
  year   = {2022}
}