中文

利用长度扰动与基于 N-best 的标签平滑提升深度神经网络声学模型泛化能力

计算与语言 2022-04-12 v1 声音 音频与语音处理

摘要

我们引入两种技术——长度扰动与基于 n-best 的标签平滑,以提升用于自动语音识别(ASR)的深度神经网络(DNN)声学模型的泛化能力。长度扰动是一种数据增强算法,随机丢弃和插入语音片段以改变语音特征序列的长度。基于 n-best 的标签平滑在训练期间向真实标签随机注入噪声以避免过拟合,其中噪声标签由 n-best 假设生成。我们在 300 小时 Switchboard(SWB300)数据集与内部 500 小时日语(JPN500)数据集上,使用递归神经网络转导器(RNNT)声学模型对这两种技术进行了广泛评估。我们表明这两种技术均能单独提升 RNNT 模型的泛化能力,并且可互为补充。特别地,它们相较强力的 SWB300 基线带来良好改进,并在 SWB300 上使用 RNNT 模型取得了最先进的性能。

关键词

引用

@article{arxiv.2203.15176,
  title  = {Improving Generalization of Deep Neural Network Acoustic Models with Length Perturbation and N-best Based Label Smoothing},
  author = {Xiaodong Cui and George Saon and Tohru Nagano and Masayuki Suzuki and Takashi Fukuda and Brian Kingsbury and Gakuto Kurata},
  journal= {arXiv preprint arXiv:2203.15176},
  year   = {2022}
}

备注

Submitted to Interspeech 2022