中文

基于预训练语言模型的判别性语音识别重打分

音频与语音处理 2023-10-11 v1

摘要

第二遍重打分是具有竞争力的自动语音识别(ASR)系统的关键组成部分。大语言模型已展现出利用预训练信息更好地对ASR假设进行重打分的能力。判别性训练直接优化最小词错率(MWER)准则,通常能改善重打分。在本研究中,我们提出并探索了几种针对预训练语言模型(LM)的判别性微调方案。我们基于不同的输出嵌入池化策略提出了两种架构,并与基于概率的MWER进行比较。我们在判别性设定下对预训练因果与双向语言模型进行了详细比较。在LibriSpeech上的实验表明,所有MWER训练方案均有益,带来了最高8.5%词错率(WER)的额外增益。所提出的池化变体在实现更低延迟的同时保留了大部分改进。最后,我们的研究得出结论:双向性在判别性训练下能得到更好的利用。

关键词

引用

@article{arxiv.2310.06248,
  title  = {Discriminative Speech Recognition Rescoring with Pre-trained Language Models},
  author = {Prashanth Gurunath Shivakumar and Jari Kolehmainen and Yile Gu and Ankur Gandhe and Ariya Rastrow and Ivan Bulyko},
  journal= {arXiv preprint arXiv:2310.06248},
  year   = {2023}
}

备注

ASRU 2023