用于远场语音识别的自回归包络去混响
音频与语音处理
2021-08-21 v2 声音
信号处理
摘要
远场环境下的语音识别任务受到混响伪影的不利影响,这些伪影表现为子带包络的时间拖尾。本文利用语音的长期子带包络开发了一种用于语音去混响的神经模型。子带包络通过使用频域线性预测(FDLP)导出,该方法对希尔伯特包络进行自回归估计。神经去混响模型估计包络增益,将其应用于混响信号时可抑制远场信号中的后期反射分量。去混响后的包络用于语音识别中的特征提取。此外,包络去混响、特征提取与声学建模用于ASR的一系列步骤可作为单一神经处理流水线实现,从而允许去混响网络与声学模型的联合学习。在REVERB挑战数据集、CHiME-3数据集和VOiCES数据集上进行了若干实验。在这些实验中,包络去混响与声学模型的联合学习相比基于对数梅尔谱图的基线ASR系统以及其他既往去混响方法取得了显著性能提升(相对基线系统平均相对改进10-24%)。还提供了关于包络去混响中超参数选择及所用代价函数的详细分析。
引用
@article{arxiv.2108.05520,
title = {Dereverberation of Autoregressive Envelopes for Far-field Speech Recognition},
author = {Anurenjan Purushothaman and Anirudh Sreeram and Rohit Kumar and Sriram Ganapathy},
journal= {arXiv preprint arXiv:2108.05520},
year = {2021}
}
备注
arXiv admin note: text overlap with arXiv:2008.03339