基于DNN的声学模型中的域扩展用于鲁棒语音识别
音频与语音处理
2019-10-02 v1 计算与语言
机器学习
摘要
用顺序到达的数据训练声学模型——同时利用新数据并避免遗忘效应——是实现语音识别达到人类智能水平的基本障碍。利用来自新域(例如新口音语音)数据的一个明显方法是:首先通过组合所有可用数据生成涵盖全部域的综合数据集,然后使用该数据集重新训练声学模型。然而,随着训练数据量增长,存储如此大规模数据集并重新训练变得实际不可行。为处理此问题,在本研究中我们研究几种域扩展技术,其仅利用新域的数据来为所有域构建更强的模型。这些技术旨在以最小遗忘效应学习新域(即保持原始模型性能)。这些技术通过施加新约束来修改自适应过程,包括:(1) 权重约束自适应(WCA):使模型参数接近原始模型参数;(2) 弹性权重巩固(EWC):对先前已建立域重要的参数放慢训练;(3) 软KL散度(SKLD):限制原始与自适应模型输出分布间的KL散度;(4) 混合SKLD-EWC:结合SKLD与EWC两种约束。我们在一个口音自适应任务中评估这些技术,其中我们将以母语英语训练的深层神经网络(DNN)声学模型自适应到三种不同英语口音:澳大利亚、西班牙裔与印度。实验结果显示SKLD显著优于EWC,且EWC优于WCA。混合SKLD-EWC技术取得最佳总体性能。
引用
@article{arxiv.1910.00565,
title = {Domain Expansion in DNN-based Acoustic Models for Robust Speech Recognition},
author = {Shahram Ghorbani and Soheil Khorram and John H. L. Hansen},
journal= {arXiv preprint arXiv:1910.00565},
year = {2019}
}
备注
Accepted at ASRU, 2019