中文

利用平行数据蒸馏知识用于远场语音识别

计算与语言 2018-02-21 v1 声音 音频与语音处理

摘要

为了提高远场语音识别的性能,本文提出利用平行数据将近讲模型的知识蒸馏到远场模型。近讲模型称为教师模型。远场模型称为学生模型。学生模型被训练以模仿教师模型的输出分布。该约束可通过最小化学生模型与教师模型输出分布之间的 Kullback-Leibler(KL)散度来实现。在 AMI 语料库上的实验结果表明,与常规训练的基线模型相比,最佳学生模型实现了高达 4.7% 的绝对词错误率(WER)降低。

关键词

引用

@article{arxiv.1802.06941,
  title  = {Distilling Knowledge Using Parallel Data for Far-field Speech Recognition},
  author = {Jiangyan Yi and Jianhua Tao and Zhengqi Wen and Bin Liu},
  journal= {arXiv preprint arXiv:1802.06941},
  year   = {2018}
}