中文

基于后验分布自适应的混合 CTC/注意力系统端到端上下文语音识别

计算与语言 2022-02-21 v1 声音 音频与语音处理

摘要

端到端(E2E)语音识别架构将传统语音识别系统的所有组件组装为单一模型。尽管其简化了 ASR 系统,却引入了上下文 ASR 缺陷:E2E 模型在包含低频专有名词的语句上性能更差。本工作中,我们提出在基于注意力的编码器-解码器(AED)模型中加入上下文偏置注意力(CBA)模块,以提升其识别上下文短语的能力。具体而言,CBA 利用解码器中源注意力的上下文向量来关注特定的偏置嵌入。CBA 与基础 AED 参数联合学习,可告知模型何时及何处对其输出概率分布进行偏置。在推理阶段,预加载一组偏置短语,并根据 CBA 所关注的偏置短语对 CTC 与注意力解码器的后验分布进行自适应。我们在 GigaSpeech 上评估所提方法,相较于基线模型,偏置短语召回率取得 15% 至 28% 的一致相对提升。同时,即便存在 2000 个偏置短语,我们的方法在通用测试上性能仅下降 1.7%,展现出强抗偏置能力。

关键词

引用

@article{arxiv.2202.09003,
  title  = {End-to-end contextual asr based on posterior distribution adaptation for hybrid ctc/attention system},
  author = {Zhengyi Zhang and Pan Zhou},
  journal= {arXiv preprint arXiv:2202.09003},
  year   = {2022}
}

备注

5 pages, 5 tabels, 1 figure