利用长度扰动与基于 N-best 的标签平滑提升深度神经网络声学模型泛化能力
计算与语言
2022-04-12 v1 声音
音频与语音处理
摘要
我们引入两种技术——长度扰动与基于 n-best 的标签平滑,以提升用于自动语音识别(ASR)的深度神经网络(DNN)声学模型的泛化能力。长度扰动是一种数据增强算法,随机丢弃和插入语音片段以改变语音特征序列的长度。基于 n-best 的标签平滑在训练期间向真实标签随机注入噪声以避免过拟合,其中噪声标签由 n-best 假设生成。我们在 300 小时 Switchboard(SWB300)数据集与内部 500 小时日语(JPN500)数据集上,使用递归神经网络转导器(RNNT)声学模型对这两种技术进行了广泛评估。我们表明这两种技术均能单独提升 RNNT 模型的泛化能力,并且可互为补充。特别地,它们相较强力的 SWB300 基线带来良好改进,并在 SWB300 上使用 RNNT 模型取得了最先进的性能。
引用
@article{arxiv.2203.15176,
title = {Improving Generalization of Deep Neural Network Acoustic Models with Length Perturbation and N-best Based Label Smoothing},
author = {Xiaodong Cui and George Saon and Tohru Nagano and Masayuki Suzuki and Takashi Fukuda and Brian Kingsbury and Gakuto Kurata},
journal= {arXiv preprint arXiv:2203.15176},
year = {2022}
}
备注
Submitted to Interspeech 2022