自动语音识别系统的选择性掩码对抗攻击
密码学与安全
2025-04-08 v1 声音
摘要
大量研究表明,自动语音识别 (ASR) 系统对音频对抗攻击十分脆弱。当前攻击主要关注单来源场景,忽略双来源场景(即两个人同时说话的情况)。为弥合这一差距,我们提出了选择性掩码对抗攻击,称为 SMA 攻击,确保在双来源场景中选择一个音频源进行识别,而另一个音频源被静音。为更好地适应双来源场景,我们的 SMA 攻击从静音音频和所选音频构建正常的双来源音频。SMA 攻击以小型高斯噪声初始化,对抗扰动,并使用选择性掩码优化算法进行迭代优化。大量实验表明,SMA 攻击能够在双来源场景中生成有效且不易察觉的音频对抗样本,在 Conformer-CTC 上实现 100% 的攻击成功率和 37.15 dB 的信噪比,优于基线方法。
引用
@article{arxiv.2504.04394,
title = {Selective Masking Adversarial Attack on Automatic Speech Recognition Systems},
author = {Zheng Fang and Shenyi Zhang and Tao Wang and Bowen Li and Lingchen Zhao and Zhangyi Wang},
journal= {arXiv preprint arXiv:2504.04394},
year = {2025}
}