中文

基于混合对抗训练的深度说话人识别对抗防御

音频与语音处理 2020-11-02 v1

摘要

基于深度神经网络的说话人识别系统容易被对手通过对输入语音样本施加微小不可感知的扰动所欺骗。这些对抗攻击对使用语音生物特征的说话人识别系统构成严重安全威胁。为解决此问题,本文提出一种基于混合对抗训练(HAT)设置的新防御机制。与现有深度说话人识别中仅利用有监督交叉熵(CE)损失的类边界信息来应对对抗攻击的工作不同,我们提出利用有监督与无监督线索的额外信息,以构造多样且更强的扰动用于对抗训练。具体而言,我们采用CE、特征散开(FS)和间隔损失的多任务目标来生成对抗扰动,并将其纳入对抗训练以增强模型鲁棒性。我们在Librispeech数据集上进行说话人识别实验,并与仅采用CE目标的最先进基于投影梯度下降(PGD)的对抗训练比较性能。所提HAT在PGD与Carlini-Wagner(CW)攻击下分别将对抗准确率绝对提升3.29%和3.18%,同时在良性样本上保持高准确率。

关键词

引用

@article{arxiv.2010.16038,
  title  = {Adversarial defense for deep speaker recognition using hybrid adversarial training},
  author = {Monisankha Pal and Arindam Jati and Raghuveer Peri and Chin-Cheng Hsu and Wael AbdAlmageed and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2010.16038},
  year   = {2020}
}

备注

Submitted to ICASSP 2021