中文

神经转导器中用于语音识别的鲁棒声学与语义上下文偏置

计算与语言 2023-05-10 v1 机器学习 声音 音频与语音处理

摘要

基于注意力的上下文偏置方法在端到端自动语音识别(E2E ASR)系统(如神经转导器)中对通用和/或个人罕见词的识别显示出显著改进。这些方法采用交叉注意力将模型偏置至作为偏置短语注入模型的特定上下文实体。先前方法通常依赖子词编码器来编码偏置短语。然而,子词分词较粗糙,无法捕捉对基于声学相似性的偏置至关重要的细粒度发音信息。本工作中,我们提出使用轻量字符表征来编码细粒度发音特征,以改进由音频与上下文实体间声学相似性引导的上下文偏置(称为声学偏置)。我们进一步集成基于预训练神经语言模型(NLM)的编码器,以编码话语的语义上下文及上下文实体,从而实现由话语语义上下文告知的偏置(称为语义偏置)。在Librispeech数据集上使用Conformer Transducer模型的实验表明,相较基线上下文模型,在融入我们所提声学与语义偏置方法后,不同偏置列表规模下相对词错率(WER)改善达4.62%–9.26%。在大规模内部数据集上,我们观察到相较基线模型有7.91%的相对WER改善。在长尾话语上,改进更为显著,Librispeech罕见词与某内部测试集分别取得36.80%与23.40%的相对WER改善。

关键词

引用

@article{arxiv.2305.05271,
  title  = {Robust Acoustic and Semantic Contextual Biasing in Neural Transducers for Speech Recognition},
  author = {Xuandi Fu and Kanthashree Mysore Sathyendra and Ankur Gandhe and Jing Liu and Grant P. Strimel and Ross McGowan and Athanasios Mouchtaris},
  journal= {arXiv preprint arXiv:2305.05271},
  year   = {2023}
}

备注

Accepted at ICASSP 2023