中文

无注册数据训练的个性化语音活动检测

声音 2021-06-24 v1 音频与语音处理

摘要

我们提出了一种新颖的个性化语音活动检测(PVAD)学习方法,该方法在训练过程中不需要注册数据。PVAD 是一项利用目标说话人的注册语音在帧级别检测该特定目标说话人语音片段的任务。由于 PVAD 必须学习说话人的语音变化以明确说话人之间的边界,已有的 PVAD 研究使用了包含每位说话人大量话语的大规模数据集。然而,用于训练 PVAD 模型的数据集往往有限,因为准备此类数据集需要高昂的成本。此外,我们无法利用用于训练标准 VAD 的数据集,因为它们通常缺少说话人标签。为解决这些问题,我们的核心思想是在训练期间将一条话语同时用作一种注册语音和 PVAD 的输入,从而实现无需注册语音的 PVAD 训练。在我们提出的方法(称为无注册训练)中,我们对一条话语进行增强,以在输入与注册语音之间制造差异性,同时保持说话人身份,从而避免训练与推理之间的不匹配。我们的实验结果证明了该方法的有效性。

关键词

引用

@article{arxiv.2106.12132,
  title  = {Enrollment-less training for personalized voice activity detection},
  author = {Naoki Makishima and Mana Ihori and Tomohiro Tanaka and Akihiko Takashima and Shota Orihashi and Ryo Masumura},
  journal= {arXiv preprint arXiv:2106.12132},
  year   = {2021}
}

备注

Accepted to INTERSPEECH 2021