中文

用于鲁棒语音类型判别的可学习谱时感受野

音频与语音处理 2020-11-12 v1

摘要

语音类型判别(VTD)指的是在录音中区分由物理上靠近录音设备的说话人产生的语音区域(“现场语音”)与播放出来的语音及其他类型音频(如交通噪声和电视广播,“干扰音频”)。在本工作中,我们提出了一种基于深度学习的 VTD 系统,其首层为可学习的谱时感受野(STRFs)。我们的方法在 ASVspoof 2019 挑战赛中类似的欺骗检测任务上也展现出非常强劲的性能。我们在一个为该领域研究支持而采集的新标准化 VTD 数据库上评估了我们的方法。特别地,我们研究了使用可学习 STRFs 相较于静态 STRFs 或无约束核的效果。我们还表明,在存在 VTD 干扰噪声的欺骗检测中,我们的系统在各种信噪比下持续改进了一个有竞争力的基线系统。

关键词

引用

@article{arxiv.2010.09151,
  title  = {Learnable Spectro-temporal Receptive Fields for Robust Voice Type Discrimination},
  author = {Tyler Vuong and Yangyang Xia and Richard Stern},
  journal= {arXiv preprint arXiv:2010.09151},
  year   = {2020}
}

备注

Accepted Interspeech 2020. Video: http://www.interspeech2020.org/index.php?m=content&c=index&a=show&catid=311&id=712