RescoreBERT:基于 BERT 的判别性语音识别重打分
音频与语音处理
2022-07-13 v3 计算与语言
机器学习
声音
摘要
第二遍重打分是自动语音识别(ASR)系统的重要组成部分,用于通过对词格重打分或 -best 重排序来改进第一遍解码器的输出。尽管以掩码语言模型(MLM)为目标的无监督预训练在各种自然语言理解(NLU)任务中取得了巨大成功,但作为 ASR 的重打分模型尚未获得关注。具体而言,在诸如最小词错率(MWER)这样的判别性目标上训练像 BERT 这样的双向模型尚未被探索。本文展示了如何以 MWER 损失训练基于 BERT 的重打分模型,将判别性损失的改进引入到 ASR 深度双向预训练模型的微调中。具体而言,我们提出了一种融合策略,将 MLM 融入判别性训练过程,以从预训练模型中有效蒸馏知识。我们进一步提出了一种替代的判别性损失。该方法被称为 RescoreBERT,在 LibriSpeech clean/other 测试集上相对 BERT 无判别性目标的基线降低了 6.6%/3.4% 的词错率(WER)。我们还在来自对话代理的内部数据集上评估了该方法,发现相比 LSTM 重打分模型,它降低了时延和 WER(相对降低 3% 至 8%)。
引用
@article{arxiv.2202.01094,
title = {RescoreBERT: Discriminative Speech Recognition Rescoring with BERT},
author = {Liyan Xu and Yile Gu and Jari Kolehmainen and Haidar Khan and Ankur Gandhe and Ariya Rastrow and Andreas Stolcke and Ivan Bulyko},
journal= {arXiv preprint arXiv:2202.01094},
year = {2022}
}
备注
Accepted to ICASSP 2022