以多领域专家模型教导全能语音识别模型
音频与语音处理
2019-07-15 v1 计算与语言
声音
摘要
在许多自动语音识别(ASR)任务中,理想模型须可跨多个领域应用。本文提出以不同领域的专家模型来教导一个全能模型。具体地,我们应用教师-学生训练框架构建多领域声学模型。首先,对每个领域,通过用领域特定子集微调多条件模型来训练一个教师模型(领域相关模型)。然后所有这些教师模型同时用于教导一个单一学生模型。我们在两种预定义领域设置上实验:一种为具有不同说话风格领域,另一种为近场、远场及带噪声远场。此外,考察了两类模型:深度前馈序列记忆网络(DFSMN)与长短期记忆(LSTM)。实验结果表明,用该框架训练的模型优于多条件模型及领域相关模型。特别地,我们的训练方法相对字符错误率较基线模型(多条件模型)最高提升 10.4%。
引用
@article{arxiv.1907.05698,
title = {Teach an all-rounder with experts in different domains},
author = {Zhao You and Dan Su and Dong Yu},
journal= {arXiv preprint arXiv:1907.05698},
year = {2019}
}
备注
5 pages and 2 figures; accepted by 2019 IEEE International Conference on Acoustics, Speech and Signal Processing