中文

用于自动说话人确认中欺骗检测的子带建模

音频与语音处理 2020-04-07 v1

摘要

语谱图——音频信号的时频表示——已在基于神经网络的欺骗检测中得到广泛应用。虽然深度模型是在信号的全频带频谱上进行训练的,但我们认为并非所有频带都对这类任务有用。在本文中,我们在两个基准数据集:ASVspoof 2017 v2.0和ASVspoof 2019 PA上,系统地研究了不同子带的影响及其在重放欺骗检测中的重要性。我们提出了一种联合子带建模框架,该框架使用n个不同的子网络来学习子带特定特征。这些特征随后被合并并传递给分类器,整个网络的权重在训练过程中更新。我们在ASVspoof 2017数据集上的发现表明,最具判别力的信息似乎出现在第一个和最后一个1 kHz频带中,并且在这两个子带上训练的联合模型表现出最佳性能,大幅优于基线。然而,这些发现并未推广到ASVspoof 2019 PA数据集上。这表明,可用于训练这些模型的数据集并未反映真实世界的重放条件,提示需要仔细设计用于训练重放欺骗对策的数据集。

关键词

引用

@article{arxiv.2004.01922,
  title  = {Subband modeling for spoofing detection in automatic speaker verification},
  author = {Bhusan Chettri and Tomi Kinnunen and Emmanouil Benetos},
  journal= {arXiv preprint arXiv:2004.01922},
  year   = {2020}
}

备注

Accepted to the Speaker Odyssey (The Speaker and Language Recognition Workshop) 2020 conference. 8 pages