中文

针对 ASR 的可迁移对抗攻击

音频与语音处理 2024-11-15 v1 人工智能 信号处理

摘要

鉴于自动语音识别(ASR)的广泛研究与现实世界应用,确保 ASR 模型对微小输入扰动的鲁棒性成为维持其在实时场景中有效性的关键考量。先前对 ASR 模型鲁棒性的探索主要集中在拥有 ASR 模型完全访问权限的白盒设置下评估准确性。然而,在现实应用中,ASR 模型的完整细节通常不可获取。因此,评估黑盒 ASR 模型的鲁棒性对于全面理解 ASR 模型的抗攻击能力至关重要。对此,我们深入研究了前沿 ASR 模型在实际黑盒攻击下的脆弱性,并提出采用两种先进的基于时域的可迁移攻击以及我们提出的可微特征提取器。我们还提出了一种用于 ASR 的语音感知梯度优化方法(SAGO),该方法通过语音活动检测规则与面向语音感知的梯度优化器,在最小化对人类不可感知性影响的同时迫使模型产生错误转录。我们全面的实验结果表明,在两个数据库的五个模型上,相较于基线方法均取得了性能提升。

关键词

引用

@article{arxiv.2411.09220,
  title  = {Transferable Adversarial Attacks against ASR},
  author = {Xiaoxue Gao and Zexin Li and Yiming Chen and Cong Liu and Haizhou Li},
  journal= {arXiv preprint arXiv:2411.09220},
  year   = {2024}
}

备注

IEEE SPL