基于扩散网络的瞬态噪声环境语音活动检测
声音
2021-06-28 v1 机器学习
音频与语音处理
摘要
我们针对现实场景中常见的瞬态与平稳噪声共存声学环境中的语音活动检测问题展开研究。我们利用语音与非语音音频帧独特空间模式,独立学习其底层几何结构。该过程通过基于深度编码器-解码器的神经网络架构完成。该结构包含一个编码器,将带有时间信息的频谱特征映射为低维表示,这些表示由扩散映射方法生成。编码器连接一个解码器,将嵌入数据映射回高维空间。通过将解码器拼接至编码器,得到训练用于区分语音与非语音帧的深度神经网络,其结构类似于已知的扩散网络(Diffusion nets)架构。实验结果表明,与同类语音活动检测方法相比性能更优,在准确率、鲁棒性与泛化能力上均有提升。我们的模型可实时运行,并能集成至基于音频的通信系统。我们还提出了一种批处理算法,可在离线应用中获得更高准确率。
引用
@article{arxiv.2106.13763,
title = {Voice Activity Detection for Transient Noisy Environment Based on Diffusion Nets},
author = {Amir Ivry and Baruch Berdugo and Israel Cohen},
journal= {arXiv preprint arXiv:2106.13763},
year = {2021}
}
备注
Accepted to IEEE journal of selected topics in signal processing 2019