语音增强辅助的端到端多任务学习语音活动检测
音频与语音处理
2021-04-14 v3 机器学习
声音
摘要
鲁棒的语音活动检测(VAD)在低信噪比(SNR)环境下是一项具有挑战性的任务。近期研究表明语音增强有助于VAD,但性能提升有限。为解决此问题,我们在此提出一种语音增强辅助的端到端多任务模型用于VAD。该模型具有两个解码器,一个用于语音增强,另一个用于VAD。两个解码器共享同一编码器和语音分离网络。与分别为VAD和语音增强设定两个独立目标的直观想法不同,我们在此提出一种新的联合优化目标——VAD掩蔽尺度不变信噪比(mSI-SDR)。mSI-SDR利用VAD信息在训练过程中掩蔽语音增强解码器的输出。它使VAD与语音增强任务不仅在共享编码器和分离网络上,而且在目标层面实现联合优化。它在理论上也满足实时工作要求。实验结果表明,该多任务方法显著优于其单任务VAD对应方法。此外,在相同多任务设定下,mSI-SDR优于SI-SDR。
引用
@article{arxiv.2010.12484,
title = {Speech enhancement aided end-to-end multi-task learning for voice activity detection},
author = {Xu Tan and Xiao-Lei Zhang},
journal= {arXiv preprint arXiv:2010.12484},
year = {2021}
}
备注
Accepted by ICASSP2021