中文

用于判别式语音识别重打分的蒸馏策略

音频与语音处理 2023-06-19 v1

摘要

多数最先进的语音识别系统都采用了第二遍重打分。近来,基于 BERT 的模型因利用掩码语言模型预训练知识对 n-best 假设重排序而流行。此外,使用如最小词错率(MWER)等判别式损失进行微调,已显示出优于基于似然的损失。具有低延迟要求的流式应用对模型大小施加了显著约束,从而限制了词错率(WER)性能的增益。本文中,我们提出从以 MWER 目标判别式训练的大模型中蒸馏的有效策略。我们在 Librispeech 与产线规模的语音助手内部数据集上实验。结果显示,相较于用 MWER 训练的学生模型,WER 相对提升最高达 7%。我们还表明,所提蒸馏能将学生与教师模型间的 WER 差距缩小 62% 至 100%。

关键词

引用

@article{arxiv.2306.09452,
  title  = {Distillation Strategies for Discriminative Speech Recognition Rescoring},
  author = {Prashanth Gurunath Shivakumar and Jari Kolehmainen and Yile Gu and Ankur Gandhe and Ariya Rastrow and Ivan Bulyko},
  journal= {arXiv preprint arXiv:2306.09452},
  year   = {2023}
}

备注

Accepted at INTERSPEECH 2023