结合音高与嗓音质量特征的卷积语音识别
音频与语音处理
2020-11-11 v2 人工智能
机器学习
声音
信号处理
摘要
本工作研究了在最先进的用于自动语音识别(Automatic Speech Recognition)的 CNN 模型中加入音高以及抖动(jitter)和微扰(shimmer)等嗓音质量特征的效果。音高特征此前已被用于改进经典的 HMM 和 DNN 基线,而抖动和微扰参数已证明对说话人或情感识别等任务有用。据我们所知,这是首项将此类音高与嗓音质量特征与现代卷积架构相结合的工作,在公开的西班牙 Common Voice 和 LibriSpeech 100h 数据集上分别取得了最高 7% 和 3% 的相对词错率(WER)提升。具体而言,我们的工作将这些特征与梅尔频率谱系数(MFSCs)结合,以训练带有门控线性单元(Conv GLUs)的卷积架构。此类模型已被证明能产生较小的词错率,且非常适用于在线流式识别场景的并行处理。我们已在 Facebook 的 wav2letter 语音识别框架中加入了音高与嗓音质量功能,并向社区提供该代码与配方以开展进一步实验。此外,据我们所知,我们的西班牙 Common Voice 配方是 wav2letter 的首个公开西班牙语配方。
引用
@article{arxiv.2009.01309,
title = {Convolutional Speech Recognition with Pitch and Voice Quality Features},
author = {Guillermo Cámbara and Jordi Luque and Mireia Farrús},
journal= {arXiv preprint arXiv:2009.01309},
year = {2020}
}
备注
5 pages