中文

探索针对端到端ASR模型的目标通用对抗扰动

音频与语音处理 2021-04-08 v1 机器学习 声音

摘要

尽管端到端自动语音识别(e2e ASR)模型已广泛应用于诸多场景,但关于模型对抗扰动的鲁棒性研究甚少。本文探讨e2e ASR模型是否存在目标通用扰动向量。我们的目标是找到这样的扰动:在任何输入语音上都能误导模型预测给定的目标转录文本,如“thank you”或空字符串。我们研究了两种不同的攻击方式,即加性扰动与前置扰动,以及它们在最先进的LAS、CTC和RNN-T模型上的表现。我们发现,在这三种模型中LAS最易受扰动攻击。RNN-T对加性扰动更为鲁棒,尤其在长语音上。而CTC对加性和前置扰动均具鲁棒性。为攻击RNN-T,我们发现前置扰动比加性扰动更有效,并能误导模型对任意长度语音预测相同的短目标。

关键词

引用

@article{arxiv.2104.02757,
  title  = {Exploring Targeted Universal Adversarial Perturbations to End-to-end ASR Models},
  author = {Zhiyun Lu and Wei Han and Yu Zhang and Liangliang Cao},
  journal= {arXiv preprint arXiv:2104.02757},
  year   = {2021}
}

备注

Submitted to INTERSPEECH 2021