端到端说话人相关语音活动检测
音频与语音处理
2020-09-22 v1 声音
摘要
语音活动检测(VAD)是自动语音识别(ASR)和说话人识别等任务的重要预处理步骤。一个基本目标是去除音频中的静音段,而更通用的 VAD 系统可去除所有无关片段,例如噪声甚至来自非目标说话人的不期望语音。我们将仅检测来自目标说话人的语音的任务定义为说话人相关语音活动检测(SDVAD)。该任务在实际应用中十分常见,通常通过在对 VAD 提取的音频段进行说话人验证(SV)来实现。本文提出一种基于端到端神经网络的方法来解决此问题,该方法将说话人身份显式地纳入建模过程。此外,推理可以在线方式进行,从而降低系统延迟。实验在由 Switchboard 语料库生成的对话电话数据集上进行。结果表明,我们所提出的在线方法在帧准确率和 F 值方面均显著优于常规的 VAD/SV 系统。我们还使用了先前提出的段级度量进行更全面的分析。
引用
@article{arxiv.2009.09906,
title = {End-to-End Speaker-Dependent Voice Activity Detection},
author = {Yefei Chen and Shuai Wang and Yanmin Qian and Kai Yu},
journal= {arXiv preprint arXiv:2009.09906},
year = {2020}
}
备注
Published in NCMMSC 2019