混响环境下基于深度学习的语音活动检测器与房间脉冲响应模型的评估
声音
2021-06-28 v1 机器学习
音频与语音处理
摘要
最先进的基于深度学习的语音活动检测器(VAD)通常在无回声数据上训练。然而,真实的声学环境通常具有混响,这会导致性能显著下降。为缓解训练数据与真实数据之间的这种不匹配,我们模拟了一个包含近五百万条语音的增广训练集。该扩展由无回声语音及其混响修正组成,后者通过将无回声语音与多种房间脉冲响应(RIR)进行卷积生成。我们考虑了五种不同的模型来生成RIR,以及五种使用增广训练集训练的VAD。我们在三种不同的真实混响环境中测试了所有训练系统。实验结果表明,与无回声训练相比,所有检测器和响应模型在准确率、精确率和召回率上平均提升了。此外,对于所测试的所有VAD,其中一种RIR模型始终比其他模型表现更好。另外,其中一种VAD在所有实验中始终优于其他VAD。
引用
@article{arxiv.2106.13511,
title = {Evaluation of Deep-Learning-Based Voice Activity Detectors and Room Impulse Response Models in Reverberant Environments},
author = {Amir Ivry and Israel Cohen and Baruch Berdugo},
journal= {arXiv preprint arXiv:2106.13511},
year = {2021}
}
备注
Accepted to ICASSP 2020