频谱掩蔽与插值攻击 (SMIA):一种针对声纹认证和反欺骗系统的黑盒对抗攻击
声音
2026-01-12 v4 人工智能
摘要
声纹认证系统 (VAS) 利用独特的声纹特征进行验证,正越来越多地集成到银行和医疗保健等高安全性领域。尽管它们通过深度学习得到了改进,但仍面临来自深度伪造和对抗攻击等复杂威胁的严重漏洞。逼真的语音克隆的出现使检测变得复杂,因为系统难以区分真实音频和合成音频。虽然存在反欺骗对策 (CMs) 来减轻这些风险,但许多对策依赖于静态检测模型,这些模型可能被新颖的对抗方法绕过,从而留下关键的安全缺口。为了证明这一漏洞,我们提出了频谱掩蔽与插值攻击 (SMIA),这是一种新颖的方法,策略性地操纵 AI 生成音频的不可听频率区域。通过在人耳无法察觉的区域改变语音,SMIA 创建了听起来真实但能欺骗反欺骗对策的对抗样本。我们在模拟现实世界条件下,针对多个任务的最先进 (SOTA) 模型对我们的攻击进行了全面评估。SMIA 对组合的 VAS/CM 系统实现了至少 82% 的攻击成功率 (ASR),对独立的说话人验证系统实现了至少 97.5% 的攻击成功率,对反欺骗对策实现了 100% 的攻击成功率。这些发现最终证明,当前的安全态势不足以应对自适应对抗攻击。这项工作凸显了向下一代防御范式转变的迫切需要,即采用能够随威胁格局演变的动态、上下文感知框架。
引用
@article{arxiv.2509.07677,
title = {Spectral Masking and Interpolation Attack (SMIA): A Black-box Adversarial Attack against Voice Authentication and Anti-Spoofing Systems},
author = {Kamel Kamel and Hridoy Sankar Dutta and Keshav Sood and Sunil Aryal},
journal= {arXiv preprint arXiv:2509.07677},
year = {2026}
}