基于预训练语言模型的判别性语音识别重打分
音频与语音处理
2023-10-11 v1
摘要
第二遍重打分是具有竞争力的自动语音识别(ASR)系统的关键组成部分。大语言模型已展现出利用预训练信息更好地对ASR假设进行重打分的能力。判别性训练直接优化最小词错率(MWER)准则,通常能改善重打分。在本研究中,我们提出并探索了几种针对预训练语言模型(LM)的判别性微调方案。我们基于不同的输出嵌入池化策略提出了两种架构,并与基于概率的MWER进行比较。我们在判别性设定下对预训练因果与双向语言模型进行了详细比较。在LibriSpeech上的实验表明,所有MWER训练方案均有益,带来了最高8.5%词错率(WER)的额外增益。所提出的池化变体在实现更低延迟的同时保留了大部分改进。最后,我们的研究得出结论:双向性在判别性训练下能得到更好的利用。
引用
@article{arxiv.2310.06248,
title = {Discriminative Speech Recognition Rescoring with Pre-trained Language Models},
author = {Prashanth Gurunath Shivakumar and Jari Kolehmainen and Yile Gu and Ankur Gandhe and Ariya Rastrow and Ivan Bulyko},
journal= {arXiv preprint arXiv:2310.06248},
year = {2023}
}
备注
ASRU 2023