MLNET:一种用于语音活动检测的自适应多感受野注意力神经网络
音频与语音处理
2020-08-14 v1 机器学习
声音
摘要
语音活动检测(VAD)区分语音与非语音,其性能对基于语音的服务至关重要。近来,基于深度神经网络(DNN)的 VAD 取得了优于传统信号处理方法的性能。已有的基于 DNN 的模型总是手工设计固定窗口以利用上下文语音信息来提升 VAD 性能。然而,上下文语音信息的固定窗口无法应对各种不可预测的噪声环境,也不能凸显对 VAD 任务关键的语音信息。为解决该问题,本文提出一种称为 MLNET 的自适应多感受野注意力神经网络来完成 VAD 任务。MLNET 利用多分支提取多种上下文语音信息,并设计有效的注意力模块为上下文中最关键的部分加权以进行最终分类。真实场景中的实验表明,所提出的基于 MLNET 的模型优于其他基线。
引用
@article{arxiv.2008.05650,
title = {MLNET: An Adaptive Multiple Receptive-field Attention Neural Network for Voice Activity Detection},
author = {Zhenpeng Zheng and Jianzong Wang and Ning Cheng and Jian Luo and Jing Xiao},
journal= {arXiv preprint arXiv:2008.05650},
year = {2020}
}
备注
will be presented in INTERSPEECH 2020