基于弱监督声音事件检测的野外语音活动检测
声音
2020-08-18 v6 音频与语音处理
摘要
传统的有监督语音活动检测(VAD)方法在干净和受控场景下表现良好,但在真实世界应用中性能严重下降。一个可能的瓶颈是野外语音包含不可预测的噪声类型,因此帧级标签预测困难,而这是传统有监督 VAD 训练所必需的。相比之下,我们提出了一种通用 VAD(GPVAD)框架,它可以通过弱监督方式轻松从含噪数据训练,仅需片段级标签。我们提出了两个 GPVAD 模型,一个全模型(GPV-F)在 527 种 Audioset 声音事件上训练,一个二分类模型(GPV-B)仅区分语音与噪声。我们在三种不同评估协议(干净、合成噪声、真实数据)上将这两个 GPV 模型与基于 CRNN 的标准 VAD 模型(VAD-C)进行比较。结果表明,我们提出的 GPV-F 在干净与合成场景下相较传统 VAD-C 具有竞争性能。此外,在真实世界评估中,GPV-F 在帧级与段级评估指标上均大幅优于 VAD-C。在对帧标注数据要求低得多的情况下,朴素的二分类片段级 GPV-B 模型在真实世界场景中仍可达到与 VAD-C 相当的性能。
引用
@article{arxiv.2003.12222,
title = {Voice activity detection in the wild via weakly supervised sound event detection},
author = {Heinrich Dinkel and Yefei Chen and Mengyue Wu and Kai Yu},
journal= {arXiv preprint arXiv:2003.12222},
year = {2020}
}
备注
Accepted in Interspeech 2020