真实场景下的语音活动检测:一种基于师生训练的数据驱动方法
声音
2021-05-11 v1 音频与语音处理
摘要
语音活动检测是自动语音识别(ASR)等语音相关任务的重要预处理组件。传统的监督式 VAD 系统通过使用例如隐马尔可夫模型从 ASR 流水线中获取帧级标签。这些 ASR 模型通常在干净且完全转写的数据上训练,限制了 VAD 系统只能在干净或合成加噪的数据集上训练。因此,监督式 VAD 系统面临的一个主要挑战是其向含噪真实世界数据的泛化能力。本工作提出了一种用于 VAD 的数据驱动师生方法,其利用海量无约束音频数据进行训练。与以往方法不同,教师训练阶段仅需弱标签,从而能够利用任何真实世界、可能含噪的数据集。我们的方法首先在源数据集(Audioset)上以片段级监督训练教师模型。训练后,教师为未标记目标数据集上的学生模型提供帧级指导。我们研究了在中等至大型数据集(Audioset、Voxceleb、NIST SRE)上训练的多种学生模型。随后我们的方法分别在干净、人工加噪和真实世界数据上进行评估。我们观察到在人工加噪和真实世界场景下性能的显著提升。最后,我们将我们的方法与其他无监督及监督 VAD 方法进行比较,证明了我们方法的优越性。
引用
@article{arxiv.2105.04065,
title = {Voice activity detection in the wild: A data-driven approach using teacher-student training},
author = {Heinrich Dinkel and Shuai Wang and Xuenan Xu and Mengyue Wu and Kai Yu},
journal= {arXiv preprint arXiv:2105.04065},
year = {2021}
}