中文

通过声学表示优化提升音频对抗样本的迁移性

声音 2025-03-26 v1 密码学与安全 机器学习 音频与语音处理

摘要

随着自动语音识别 (ASR) 系统的广泛应用,其对对抗攻击的脆弱性已受到广泛研究。然而,大多数现有对抗样本是在特定单个模型上生成的,导致其迁移性差。在实际场景中,攻击者往往无法获取目标模型的详细信息,使基于查询的方法攻击不可行。为解决这一挑战,我们提出了一种称为声学表示优化 (Acoustic Representation Optimization) 的技术,通过对齐对抗扰动与从语音表示模型中导出的低级声学特征来实现这一目标。我们的做法不依赖于依赖模型特定的高层抽象,而是利用保持跨 diverse ASR 架构一致性的基本声学表示。通过强制声学表示损失引导扰动向这些稳健的低层表示,以提升对抗样本的跨模型迁移性,同时不降低音频质量。该方法即插即用,可集成到任何现有攻击方法中。我们在三个现代 ASR 模型上进行评估,实验结果表明,我们的方法显著提高了由先前方法生成的对抗样本的迁移性,同时保持了音频质量。

关键词

引用

@article{arxiv.2503.19591,
  title  = {Boosting the Transferability of Audio Adversarial Examples with Acoustic Representation Optimization},
  author = {Weifei Jin and Junjie Su and Hejia Wang and Yulin Ye and Jie Hao},
  journal= {arXiv preprint arXiv:2503.19591},
  year   = {2025}
}

备注

Accepted to ICME 2025