中文

Personal VAD:说话人条件化的语音活动检测

音频与语音处理 2020-04-09 v4 机器学习 机器学习

摘要

本文提出“personal VAD”,一种在帧级别检测目标说话人语音活动的系统。该系统可用于门控流式端侧语音识别系统的输入,使其仅对目标用户触发,有助于降低计算成本与电池消耗,尤其在关键词检测器不适用场景中。我们通过训练一个类 VAD 的神经网络实现该目的,该网络以目标说话人嵌入或说话人验证分数为条件。对于每一帧,personal VAD 输出三类概率:非语音、目标说话人语音、非目标说话人语音。在最优设置下,我们训练出一个仅 130K 参数的模型,优于将单独训练的标准 VAD 与说话人识别网络组合执行相同任务的基线系统。

关键词

引用

@article{arxiv.1908.04284,
  title  = {Personal VAD: Speaker-Conditioned Voice Activity Detection},
  author = {Shaojin Ding and Quan Wang and Shuo-yiin Chang and Li Wan and Ignacio Lopez Moreno},
  journal= {arXiv preprint arXiv:1908.04284},
  year   = {2020}
}

备注

Speaker Odyssey 2020