中文

利用大型文本语料库改进审议式端到端语音识别模型的尾部性能

音频与语音处理 2020-08-26 v2 机器学习

摘要

端到端(E2E)自动语音识别(ASR)系统缺乏传统语音系统所特有的独立语言模型(LM)组件。虽然这简化了模型架构,却使将纯文本数据纳入训练的任务变得复杂,而这对于识别在音频-文本对中不常出现的尾部词至关重要。尽管浅融合(shallow fusion)已被提出作为一种在推理时将预训练 LM 纳入 E2E 模型的方法,但其在超大型文本语料库上的应用尚未被探索,且已被证明对束搜索中的超参数设置非常敏感。在本工作中,我们应用浅融合将超大型文本语料库纳入最先进的 E2E ASR 模型。我们探究了模型规模的影响,并表明对训练集进行智能剪枝可能比增加参数量更有效。此外,我们表明在最小词错误率(MWER)微调中纳入 LM 可使浅融合大大降低对最优超参数设置的依赖,从而减轻该调参问题的难度。

关键词

引用

@article{arxiv.2008.10491,
  title  = {Improving Tail Performance of a Deliberation E2E ASR Model Using a Large Text Corpus},
  author = {Cal Peyser and Sepand Mavandadi and Tara N. Sainath and James Apfel and Ruoming Pang and Shankar Kumar},
  journal= {arXiv preprint arXiv:2008.10491},
  year   = {2020}
}