中文

非平稳声学环境下基于统计与神经网络的语音活动检测

音频与语音处理 2020-07-29 v2 声音

摘要

语音活动检测(SAD)通常依赖于噪声比语音“更”平稳这一事实,在非平稳环境中尤其具有挑战性,因为声学场景的时间变化使得区分语音与噪声变得困难。我们提出两种 SAD 方法,一种基于统计信号处理,另一种利用神经网络。前者采用精细的信号处理来跟踪噪声与语音能量,旨在支持一种资源高效、无监督的信号处理方法。后者引入一个递归网络层,在输入语音的短片段上操作,以在非平稳噪声存在时进行时间平滑。这些系统在 Fearless Steps 挑战赛(由阿波罗11号太空任务的传输数据组成)上进行了测试。统计 SAD 取得了与早前提出的基于神经网络的 SAD 相当的 detection 性能,而基于神经网络的方法在 2020 年 Fearless Steps 挑战赛的评估集上取得了 1.07% 的决策代价函数,创下了新的最先进水平。

关键词

引用

@article{arxiv.2005.09913,
  title  = {Statistical and Neural Network Based Speech Activity Detection in Non-Stationary Acoustic Environments},
  author = {Jens Heitkaemper and Joerg Schmalenstroeer and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:2005.09913},
  year   = {2020}
}

备注

Accepted to Interspeech 2020