中文

近期用于合成语音检测的神经网络欺骗 countermeasure 比较研究

音频与语音处理 2021-06-15 v2

摘要

近期关于语音欺骗 countermeasure 的大量研究工作投入于后端神经网络和训练准则。我们在本研究中以比较的视角对此作出贡献。我们在 ASVspoof 2019 逻辑访问任务上对 countermeasure 模型进行比较,考虑了近期提出的基于边界的训练准则、广泛使用的前端,以及处理变长输入试样的常用策略。我们还通过多次随机初始化的训练-评估轮次来度量模型内差异。我们的统计分析表明,仅改变随机初始种子时,同一模型的性能可能存在显著差异。因此,我们建议在该数据库上的进一步研究中采用类似的分析或多次训练-评估轮次。尽管存在模型内差异,我们观察到若干有前景的技术,例如用于处理变长输入的平均池化,以及一种新的无超参数损失函数。这两种技术在我们的实验中带来了最佳单一模型,其等错误率达到 1.92%,并且在统计意义上与大多数其他实验模型显著不同。

关键词

引用

@article{arxiv.2103.11326,
  title  = {A Comparative Study on Recent Neural Spoofing Countermeasures for Synthetic Speech Detection},
  author = {Xin Wang and Junich Yamagishi},
  journal= {arXiv preprint arXiv:2103.11326},
  year   = {2021}
}

备注

Interspeech 2021