中文

深度说话人识别系统的对抗攻击与防御策略

音频与语音处理 2021-02-19 v1 机器学习 声音

摘要

鲁棒的说话人识别(包括在恶意攻击存在的情况下)正变得愈发重要和不可或缺,尤其是由于若干智能音箱和个人代理的普及,它们通过个人的语音指令来执行多样化甚至敏感的任务。对抗攻击是近期复兴的一个领域,已被证明能有效破坏基于深度神经网络的分类器,具体是通过仅对输入样本施加极少量扰动来迫使其改变后验分布。尽管该领域在计算机视觉领域已取得显著进展,但说话人识别内的进展仍然有限。本综述性论文考虑了对深度说话人识别系统的几种最先进对抗攻击,采用强防御方法作为对策,并报告了若干消融研究以获得对该问题的全面理解。实验表明,说话人识别系统易受对抗攻击,最强的攻击可将系统准确率从94%降至甚至0%。该研究还详细比较了所采用防御方法的性能,发现基于投影梯度下降(PGD)的对抗训练在我们的设定中是最佳防御方法。我们希望本文呈现的实验能提供基线,对进一步研究说话人识别系统对抗鲁棒性的研究界有所助益。

关键词

引用

@article{arxiv.2008.07685,
  title  = {Adversarial Attack and Defense Strategies for Deep Speaker Recognition Systems},
  author = {Arindam Jati and Chin-Cheng Hsu and Monisankha Pal and Raghuveer Peri and Wael AbdAlmageed and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2008.07685},
  year   = {2021}
}