用于语音识别的核近似方法
机器学习
2019-01-25 v1 人工智能
计算与语言
机器学习
摘要
我们研究大规模核方法在语音识别声学建模中的应用,并将其性能与深度神经网络(DNNs)进行比较。我们在四个语音识别数据集上进行了实验,包括 TIMIT 和 Broadcast News 基准任务,并在帧级性能指标(准确率、交叉熵)以及识别指标(词/字符错误率)上比较这两类模型。为了将核方法扩展到这些大型数据集,我们使用了 Rahimi 和 Recht(2007)的随机傅里叶特征方法。我们提出了两种改进核声学模型性能的新技术。首先,为了减少核模型所需的随机特征数量,我们提出了一种简单但有效的特征选择方法。该方法能够探索大量非线性特征,同时比现有方法更高效地保持紧凑模型。其次,我们提出了一系列帧级指标,当在留出集(heldout set)上计算时,这些指标与识别性能高度相关;我们利用这些相关性,在训练期间监控这些指标以决定何时停止学习。该技术能明显改善 DNN 和核模型的识别性能,同时缩小两者之间的差距。此外,我们展示了 Sainath 等人(2013)的线性瓶颈方法除了加速训练并使模型更紧凑外,还显著提升了我们的核模型性能。这三种方法共同大幅提升了核声学模型的性能,使其在我们探索的任务上达到与 DNNs 相当的水平。
引用
@article{arxiv.1701.03577,
title = {Kernel Approximation Methods for Speech Recognition},
author = {Avner May and Alireza Bagheri Garakani and Zhiyun Lu and Dong Guo and Kuan Liu and Aurélien Bellet and Linxi Fan and Michael Collins and Daniel Hsu and Brian Kingsbury and Michael Picheny and Fei Sha},
journal= {arXiv preprint arXiv:1701.03577},
year = {2019}
}