中文

在自监督学习框架下改进基于流式 Transformer 的 ASR

音频与语音处理 2021-09-16 v1 声音

摘要

近来,自监督学习已成为一种改进自动语音识别(ASR)性能的有效方法。在此框架下,神经网络通常先用大量无标注数据预训练,再用有限的标注数据微调。然而,为取得有竞争力的结果,神经网络通常采用如双向 transformer 之类的非流式架构,这无法用于流式场景。本文主要关注在自监督学习框架下改进流式 transformer 的性能。具体而言,我们在微调期间提出一种结合知识蒸馏与自训练的新颖两阶段训练方法。所提训练方法在 Librispeech 含噪测试集上取得了 16.3% 的相对词错误率(WER)降低。最后,仅使用 Librispeech 的 100h 干净子集作为标注数据、其余(860h)作为无标注数据,我们基于流式 transformer 的模型在 Librispeech 干净/含噪测试集上取得了具竞争力的 WER 3.5/8.7。

关键词

引用

@article{arxiv.2109.07327,
  title  = {Improving Streaming Transformer Based ASR Under a Framework of Self-supervised Learning},
  author = {Songjun Cao and Yueteng Kang and Yanzhe Fu and Xiaoshuo Xu and Sining Sun and Yike Zhang and Long Ma},
  journal= {arXiv preprint arXiv:2109.07327},
  year   = {2021}
}

备注

INTERSPEECH2021