中文

面向序列到序列 ASR 的 BERT 知识蒸馏

计算与语言 2020-08-11 v1 音频与语音处理

摘要

基于注意力的序列到序列(seq2seq)模型在自动语音识别(ASR)中取得了有前景的结果。然而,由于这些模型以从左到右的方式解码,它们无法获取右侧的上下文。我们通过将 BERT 作为外部语言模型,经由知识蒸馏应用于 seq2seq ASR,从而同时利用左右上下文。在我们提出的方法中,BERT 生成软标签以指导 seq2seq ASR 的训练。此外,我们利用当前语句之外的上下文作为 BERT 的输入。实验评估表明,在日语自发语音语料库(CSJ)上,我们的方法相较 seq2seq 基线显著提升了 ASR 性能。来自 BERT 的知识蒸馏优于仅关注左侧上下文的 transformer 语言模型(LM)的蒸馏。我们还展示了利用当前语句之外上下文的有效性。我们的方法优于其他 LM 应用方法(如 n-best 重打分和浅融合),且不需要额外的推理开销。

关键词

引用

@article{arxiv.2008.03822,
  title  = {Distilling the Knowledge of BERT for Sequence-to-Sequence ASR},
  author = {Hayato Futami and Hirofumi Inaguma and Sei Ueno and Masato Mimura and Shinsuke Sakai and Tatsuya Kawahara},
  journal= {arXiv preprint arXiv:2008.03822},
  year   = {2020}
}

备注

Accepted in INTERSPEECH2020