中文

利用带多分支编码器的全卷积网络实现基于波形的语音活动检测

音频与语音处理 2020-06-22 v1

摘要

在本研究中,我们提出一种编码器-解码器结构的全卷积网络系统,以直接在时域波形上实现语音活动检测(VAD)。所提系统处理输入波形以识别其片段为语音或非语音。这一新颖的基于波形的 VAD 算法,简记为“WVAD”,有两个主要特点。首先,与多数使用频谱特征的常规 VAD 系统相比,WVAD 采用的原始波形包含更全面的信息,因此有望促成更精确的语音/非语音预测。其次,基于多分支架构,WVAD 可通过使用称为 WEVAD 的编码器集成进行扩展,其融合了话语中的多属性信息,从而能在特定声学条件下取得更好的 VAD 性能。我们在两个数据集上评估了所提出的 WVAD 与 WEVAD 的 VAD 任务:首先,在 AURORA2 上的实验显示 WVAD 优于许多最先进的 VAD 算法。接着,TMHINT 任务证实通过结合话语中多属性,WEVAD 表现甚至优于 WVAD。

关键词

引用

@article{arxiv.2006.11139,
  title  = {Waveform-based Voice Activity Detection Exploiting Fully Convolutional networks with Multi-Branched Encoders},
  author = {Cheng Yu and Kuo-Hsuan Hung and I-Fan Lin and Szu-Wei Fu and Yu Tsao and Jeih-weih Hung},
  journal= {arXiv preprint arXiv:2006.11139},
  year   = {2020}
}