中文

rVAD:一种无监督的基于分段的鲁棒语音活动检测方法

声音 2022-01-12 v2 计算与语言 机器学习 音频与语音处理

摘要

本文提出一种用于鲁棒语音活动检测(rVAD)的无监督基于分段的方法。该方法由两遍去噪及随后的语音活动检测(VAD)阶段组成。在第一遍中,利用后验信噪比(SNR)加权能量差检测语音信号中的高能段,若某段内未检测到基音,则该段被视为高能噪声段并置零。在第二遍中,通过语音增强方法对语音信号去噪,对此探索了若干方法。接着,将具有基音的相邻帧分组形成基音段,并基于语音统计从两端进一步扩展基音段,以同时包含浊音、清音及可能的非语音部分。最后,对去噪语音信号的扩展基音段施加后验 SNR 加权能量差以检测语音活动。我们利用包含大量噪声条件的两个数据库 RATS 和 Aurora-2 评估所提方法的 VAD 性能。rVAD 方法还在 RedDots 2016 挑战数据库及其加噪版本上就说话人验证性能进行了进一步评估。实验结果表明,rVAD 与多种现有方法相比具有优势。此外,我们给出了 rVAD 的改进版本,以计算高效的谱平坦度计算替代计算密集的基音提取。该改进版本以 VAD 性能中等下降为代价显著降低了计算复杂度,这在处理大量数据及在低资源设备上运行时具有优势。rVAD 的源代码已公开可用。

关键词

引用

@article{arxiv.1906.03588,
  title  = {rVAD: An Unsupervised Segment-Based Robust Voice Activity Detection Method},
  author = {Zheng-Hua Tan and Achintya kr. Sarkar and Najim Dehak},
  journal= {arXiv preprint arXiv:1906.03588},
  year   = {2022}
}