中文

用于语音识别的基于 BERT 的创新重排序语言模型

计算与语言 2021-04-13 v1 声音 音频与语音处理

摘要

近来,Bidirectional Encoder Representations from Transformers(BERT)被提出,并因有效的预训练后微调范式以及强大的局部上下文建模能力,在许多自然语言处理(NLP)任务(如问答与语言理解)上取得令人瞩目的成功。有鉴于此,本文提出一种基于 BERT 的上下文语言模型(LM)的新实例,用于自动语音识别(ASR)产生的 N-best 候选重排序。为此,我们将基于 BERT 的 N-best 候选重排序构建为预测问题,旨在给定 N-best 候选时预测具有最低词错误率(WER)的 oracle 候选(记为 PBERT)。特别地,我们还探索以无监督方式利用任务特定的全局主题信息辅助 PBERT 进行 N-best 候选重排序(记为 TPBERT)。在 AMI 基准语料库上进行的大量实验证明了我们的方法相对于常规自回归模型(如循环神经网络(RNN))以及最近提出的采用 BERT 计算伪对数似然(PLL)分数进行 N-best 候选重排序的方法的有效性与可行性。

关键词

引用

@article{arxiv.2104.04950,
  title  = {Innovative Bert-based Reranking Language Models for Speech Recognition},
  author = {Shih-Hsuan Chiu and Berlin Chen},
  journal= {arXiv preprint arXiv:2104.04950},
  year   = {2021}
}

备注

6 pages, 3 figures, Published in IEEE SLT 2021