利用平行数据蒸馏知识用于远场语音识别
计算与语言
2018-02-21 v1 声音
音频与语音处理
摘要
为了提高远场语音识别的性能,本文提出利用平行数据将近讲模型的知识蒸馏到远场模型。近讲模型称为教师模型。远场模型称为学生模型。学生模型被训练以模仿教师模型的输出分布。该约束可通过最小化学生模型与教师模型输出分布之间的 Kullback-Leibler(KL)散度来实现。在 AMI 语料库上的实验结果表明,与常规训练的基线模型相比,最佳学生模型实现了高达 4.7% 的绝对词错误率(WER)降低。
引用
@article{arxiv.1802.06941,
title = {Distilling Knowledge Using Parallel Data for Far-field Speech Recognition},
author = {Jiangyan Yi and Jianhua Tao and Zhengqi Wen and Bin Liu},
journal= {arXiv preprint arXiv:1802.06941},
year = {2018}
}