利用低秩与稀疏软目标学习更好的 DNN 声学模型
计算与语言
2017-09-07 v1 人工智能
人机交互
机器学习
摘要
用于语音声学建模的传统深度神经网络 (DNN) 依赖高斯混合模型 (GMM) 和隐马尔可夫模型 (HMM) 获取二元类别标签,作为 DNN 训练的目标。语音识别系统中的子词类对应于上下文相关绑定状态或音素状态 (senones)。本研究旨在解决 GMM-HMM 音素状态对齐在 DNN 训练中的一些局限性。我们假设,由二元标签训练的 DNN 所获得的音素状态概率能够提供更准确的目标,从而学习更好的声学模型。然而,DNN 输出存在不准确性,表现为高维无结构噪声,而信息成分是结构化的且低维的。我们利用主成分分析 (PCA) 与稀疏编码来刻画音素状态子空间。由低秩与稀疏重构获得的增强概率被用作 DNN 声学建模的软目标,这也使得利用未转录数据进行训练成为可能。在 AMI 语料库上进行的实验表明,词错误率相对降低了 4.6%。
引用
@article{arxiv.1610.05688,
title = {Low-rank and Sparse Soft Targets to Learn Better DNN Acoustic Models},
author = {Pranay Dighe and Afsaneh Asaei and Herve Bourlard},
journal= {arXiv preprint arXiv:1610.05688},
year = {2017}
}