声学标志点比其它帧包含更多关于音子串的信息:基于深度神经网络声学模型的自动语音识别
音频与语音处理
2018-07-04 v2 声音
摘要
大多数主流的自动语音识别(ASR)系统将所有特征帧视为同等重要。然而,声学标志点理论基于一个相反的观点,即某些帧比其它帧更重要。声学标志点理论利用发音-声学与声学-感知关系中的量子化非线性,来定义语音频谱突然变化或达到极值的标志点时刻;已有研究表明,与标志点重叠的帧足以用于语音感知。在这项工作中,我们在 TIMIT 语料库上基于 GMM 和 DNN 的 ASR 系统进行了实验,发现包含标志点的帧比其它帧对 ASR 更具信息量。我们发现,通过重新加权声学似然来改变对标志点的强调程度,往往能降低音子错误率(PER)。此外,利用标志点作为一种启发式方法,我们的一种混合 DNN 帧丢弃策略在仅对不到一半(精确为 45.8%)的帧进行打分的情况下,将 PER 维持在最优值的 0.44% 以内。该混合策略优于其它非基于启发式的方法,并展示了标志点在减少计算量方面的潜力。
引用
@article{arxiv.1710.09985,
title = {Acoustic Landmarks Contain More Information About the Phone String than Other Frames for Automatic Speech Recognition with Deep Neural Network Acoustic Model},
author = {Di He and Boon Pang Lim and Xuesong Yang and Mark Hasegawa-Johnson and Deming Chen},
journal= {arXiv preprint arXiv:1710.09985},
year = {2018}
}
备注
The article has been submitted to Journal of the Acoustical Society of America