中文

学习欺骗说话人识别系统

音频与语音处理 2020-04-08 v1 密码学与安全 声音

摘要

由于指纹/人脸/说话人识别系统被广泛部署,攻击基于深度学习的生物特征系统已引起越来越多的关注。以往研究主要考察对基于视觉的系统的攻击,如指纹和人脸识别。而尽管说话人识别已在日常生活中广泛使用,针对它的攻击尚未被研究。本文尝试欺骗最先进的说话人识别模型,并提出说话人识别攻击者(speaker recognition attacker),一种轻量模型,通过对原始语音波形添加不可感知扰动来欺骗深度说话人识别模型。我们发现说话人识别系统同样易受攻击,并在非定向攻击上取得了高成功率。此外,我们还提出一种优化说话人识别攻击者的有效方法,以在攻击成功率与感知质量之间取得权衡。在 TIMIT 数据集上的实验表明,我们可实现 99.2%99.2\% 的句子错误率,平均 SNR 为 57.2dB57.2\text{dB},PESQ 为 4.2,且速度远快于实时。

关键词

引用

@article{arxiv.2004.03434,
  title  = {Learning to fool the speaker recognition},
  author = {Jiguo Li and Xinfeng Zhang and Jizheng Xu and Li Zhang and Yue Wang and Siwei Ma and Wen Gao},
  journal= {arXiv preprint arXiv:2004.03434},
  year   = {2020}
}

备注

Accepted by ICASSP2020