中文

数据集对自动语音识别声学模型的影响

机器学习 2022-03-28 v1 计算与语言 声音 音频与语音处理

摘要

在自动语音识别中,GMM-HMM 曾被广泛用于声学建模。随着当前深度学习的进展,声学模型中的高斯混合模型(GMM)已被深度神经网络取代,即 DNN-HMM 声学模型。GMM 模型被广泛用于为混合深度神经网络模型创建训练数据的对齐,因此生成准确对齐是一项重要任务。训练数据集规模、训练数据增强、模型超参数等诸多因素会影响模型学习。传统上在机器学习中,较大的数据集往往具有更好的性能,而较小的数据集往往引发过拟合。语音数据及其准确转写的收集是一项重大挑战,在不同语言间有所差异,且在大多数情况下可能仅限于大型机构。此外,在存在可用大型数据集的情况下,使用此类数据训练模型需要额外的时间和计算资源,而这些可能并不具备。虽然关于最先进 ASR 模型在开源数据集上准确率的数据已有发表,但关于数据集规模对声学模型影响的研究尚不易获得。本工作旨在研究数据集规模变化对各种 GMM-HMM 声学模型性能及其相应计算成本的影响。

关键词

引用

@article{arxiv.2203.13590,
  title  = {Impact of Dataset on Acoustic Models for Automatic Speech Recognition},
  author = {Siddhesh Singh},
  journal= {arXiv preprint arXiv:2203.13590},
  year   = {2022}
}