中文

利用 x-vector 攻击嵌入与谱特征的语音重放检测

计算与语言 2019-09-27 v1

摘要

我们介绍了提交至 ASVspoof 2019 挑战赛物理接入(PA)任务的系统。该挑战的目标是开发一种反制措施,将语音音频识别为真实语音或被截获并重放的语音。目标预测为一个指示语音段为真实(正值)或“欺骗”(负值)的值。我们的系统使用卷积神经网络(CNNs)以及一种结合 x-vector 攻击嵌入与信号处理特征的语音音频表示。x-vector 攻击嵌入由梅尔频率倒谱系数(MFCCs)通过时延神经网络(TDNN)创建。这些嵌入联合建模了来自标注数据的 27 种不同环境与 9 类攻击。我们还使用了子带谱质心幅度系数(SCMCs)作为特征。我们在训练中加入加性高斯噪声层,以此扩充数据,使系统对未见过的攻击样本更鲁棒。我们使用串联检测代价函数(tDCF)与等错误率(EER)报告系统性能。我们的方法优于两项挑战基线。我们的技术表明,即便环境与攻击更具挑战性,我们的 x-vector 攻击嵌入也能帮助正则化 CNN 预测。

关键词

引用

@article{arxiv.1909.10324,
  title  = {Speech Replay Detection with x-Vector Attack Embeddings and Spectral Features},
  author = {Jennifer Williams and Joanna Rownicka},
  journal= {arXiv preprint arXiv:1909.10324},
  year   = {2019}
}

备注

Presented at Interspeech 2019