中文

用于语音识别的 LF-MMI 训练时延神经网络的贝叶斯学习

音频与语音处理 2021-05-11 v3

摘要

区分性训练技术定义了自动语音识别系统的最先进性能。然而,它们本质上容易过拟合,在使用有限训练数据时导致泛化性能不佳。为解决此问题,本文提出一个完整的贝叶斯框架,以考虑因子化 TDNN 声学模型序列区分性训练中的模型不确定性。提出了几种基于贝叶斯学习的 TDNN 变体系统,用于对权重参数和隐藏激活函数的选择或隐藏层输出的不确定性进行建模。使用少至单个参数样本的高效变分推断方法,确保了它们在训练和评估时的计算成本与基线 TDNN 系统相当。在一个使用多种正则化方法(包括 F-smoothing、L2 范数惩罚、自然梯度、模型平均和 dropout)以及基于 i-Vector 加学习隐藏单元贡献(LHUC)的说话人自适应和 RNNLM 重打分训练的、最先进的 900 小时速度扰动 Switchboard 语料库基线 LF-MMI 因子化 TDNN 系统上,获得了统计显著的词错误率(WER)绝对降低 0.4%–1.8%(相对 5%–11%)。在 450 小时 HKUST 普通话电话会话语音识别任务上也取得了持续的性能提升。在第三个跨域自适应任务中,需要将一个在 1000 小时 LibriSpeech 数据上训练的系统快速移植到小型 DementiaBank 老年语音语料库,所提出的贝叶斯 TDNN LF-MMI 系统比使用直接权重微调的基线系统高出最多 2.5% 的绝对 WER 降低。

关键词

引用

@article{arxiv.2012.04494,
  title  = {Bayesian Learning of LF-MMI Trained Time Delay Neural Networks for Speech Recognition},
  author = {Shoukang Hu and Xurong Xie and Shansong Liu and Jianwei Yu and Zi Ye and Mengzhe Geng and Xunying Liu and Helen Meng},
  journal= {arXiv preprint arXiv:2012.04494},
  year   = {2021}
}

备注

Published in TASLP