中文

利用自注意力 U-Net 增强刻画语音对抗样本

音频与语音处理 2022-01-04 v2 计算与语言 密码学与安全 机器学习 声音

摘要

近期研究强调对抗样本是基于深度神经网络(DNN)的语音识别系统的普遍威胁。本工作中,我们提出一种基于 U-Net 的注意力模型 U-NetAt_{At},用于增强对抗语音信号。具体而言,我们通过可解释的语音识别指标评估模型性能,并借助增广对抗训练讨论模型表现。我们的实验表明,在针对对抗语音样本的语音增强任务上,所提出的 U-NetAt_{At} 将感知语音质量评价(PESQ)从 1.13 提升至 2.78,语音传输指数(STI)从 0.65 提升至 0.75,短时客观可懂度(STOI)从 0.83 提升至 0.96。我们在自动语音识别(ASR)任务上针对对抗音频攻击开展实验。我们发现:(i)注意力网络学习到的时间特征能够增强基于 DNN 的 ASR 模型的鲁棒性;(ii)通过引入附加对抗数据增广的对抗训练,可提升基于 DNN 的 ASR 模型的泛化能力。词错误率(WERs)这一 ASR 指标显示,在基于梯度的扰动下绝对下降 2.22 %\%,在进化优化扰动下绝对下降 2.03 %\%,这表明我们的增强模型结合对抗训练能够进一步保障 ASR 系统的弹性。

关键词

引用

@article{arxiv.2003.13917,
  title  = {Characterizing Speech Adversarial Examples Using Self-Attention U-Net Enhancement},
  author = {Chao-Han Huck Yang and Jun Qi and Pin-Yu Chen and Xiaoli Ma and Chin-Hui Lee},
  journal= {arXiv preprint arXiv:2003.13917},
  year   = {2022}
}

备注

The authors have revised some annotations in Table 4 to improve the clarity. The authors thank reading feedbacks from Jonathan Le Roux. The first draft was finished in August 2019. Accepted to IEEE ICASSP 2020