中文

面向基于注意力序列到序列语音识别模型压缩的序列级知识蒸馏

计算与语言 2018-11-13 v1

摘要

我们研究了面向大词汇量连续语音识别(LVSCR)的序列到序列(Seq2Seq)模型的序列级知识蒸馏的可行性。我们首先使用预训练的较大教师模型通过束搜索为每个语音片段生成多个假设。在相同输入下,我们使用教师生成的这些假设作为伪标签替代原始真实标签来训练学生模型。我们使用华尔街日报(WSJ)语料库评估所提出的方法。其实现了高达 9.8× 9.8 \times 的参数缩减,准确率损失为词错误率(WER)上升至多 7.0\%。

关键词

引用

@article{arxiv.1811.04531,
  title  = {Sequence-Level Knowledge Distillation for Model Compression of Attention-based Sequence-to-Sequence Speech Recognition},
  author = {Raden Mu'az Mun'im and Nakamasa Inoue and Koichi Shinoda},
  journal= {arXiv preprint arXiv:1811.04531},
  year   = {2018}
}