结合DNN模型与GMM模型的语音活动检测方案
声音
2020-05-19 v1 音频与语音处理
摘要
由于深度神经网络(DNN)优越的建模能力,其被广泛应用于语音活动检测(VAD)。然而,若无法获得充足数据(尤其是实际数据)用于训练,性能可能下降,从而导致对环境适应能力较弱。此外,大型模型结构并非总能用于实际,特别是在使用受限硬件的低成本设备中。这与高斯混合模型(GMM)相反,其模型参数可实时更新,但建模能力较低。本文提出深度集成这两种模型的方案,以提升适应性与建模能力。具体通过将模型结果直接结合并反馈,连同DNN模型结果一起用于更新GMM模型。此外,精心设计了控制方案以检测语音端点。实际实验验证了该方案的优越性能,揭示了结合监督学习与无监督学习的优势。
引用
@article{arxiv.2005.08184,
title = {Voice Activity Detection Scheme by Combining DNN Model with GMM Model},
author = {Lu Ma and Xiaomeng Zhang and Pei Zhao and Tengrong Su},
journal= {arXiv preprint arXiv:2005.08184},
year = {2020}
}