中文

利用生成对抗网络进行语音活动检测的时间感知上下文建模

音频与语音处理 2020-04-06 v1 机器学习 声音 机器学习

摘要

本文提出了一种新颖的语音活动检测(SAD)框架。受多任务学习方法近期在语音处理领域取得成功的启发,我们提出了一种新颖的 SAD 联合学习框架。我们利用生成对抗网络自动学习一个损失函数,用于联合预测逐帧的语音/非语音分类以及下一个音频片段。为了利用输入信号内的时间关系,我们提出了一个时间判别器,旨在确保预测信号在时间上的一致性。我们在多个公开基准测试上评估了所提出的框架,包括 NIST OpenSAT' 17、AMI Meeting 和 HAVIC,展示了其优于现有 SAD 方法的能力。此外,我们的跨数据库评估证明了所提出的方法在不同语言、口音和声学环境下的鲁棒性。

关键词

引用

@article{arxiv.2004.01546,
  title  = {Temporarily-Aware Context Modelling using Generative Adversarial Networks for Speech Activity Detection},
  author = {Tharindu Fernando and Sridha Sridharan and Mitchell McLaren and Darshana Priyasad and Simon Denman and Clinton Fookes},
  journal= {arXiv preprint arXiv:2004.01546},
  year   = {2020}
}