中文

用于端到端中文语音识别的尖峰触发上下文偏置方法

音频与语音处理 2023-10-10 v1 声音

摘要

基于注意力的深度上下文偏置方法已被证明能有效提升端到端自动语音识别(ASR)系统在给定上下文短语上的识别性能。然而,与直接偏置 ASR 模型后验的浅融合方法不同,深度偏置方法隐式地整合上下文信息,使得偏置程度难以控制。在本研究中,我们引入一种尖峰触发的深度偏置方法,同时支持显式与隐式偏置。此外,两种偏置方法均展现出显著改进,并且可与浅融合方法级联以获得更好结果。进一步地,我们提出了上下文采样增强策略并改进了上下文短语过滤算法。在公开 WenetSpeech 中文偏置词数据集上的实验显示,相比基线模型相对 CER 降低 32.0%,在上下文短语上相对 CER 降低达令人印象深刻的 68.6%。

关键词

引用

@article{arxiv.2310.04657,
  title  = {Spike-Triggered Contextual Biasing for End-to-End Mandarin Speech Recognition},
  author = {Kaixun Huang and Ao Zhang and Binbin Zhang and Tianyi Xu and Xingchen Song and Lei Xie},
  journal= {arXiv preprint arXiv:2310.04657},
  year   = {2023}
}

备注

Accepted by ASRU2023