中文

基于能量掩码的对抗性规避攻击方法用于扬声器识别系统中的误分类

声音 2026-02-02 v1 密码学与安全 音频与语音处理

摘要

对抗性规避攻击对 AI 系统构成重大威胁,利用机器学习模型的漏洞绕过检测机制。语音数据(包括深度伪造)在众多前景产业中的广泛应用目前受限于法律框架不足。对抗攻击方法已成为最有效的反措施。本研究引入了掩码能量扰动(MEP),一种利用功谱对原始语音数据进行能量掩码的新方法。MEP 在生成对抗性扰动前对频域中小能量区域进行掩码处理,针对人类听觉模型中不太显眼的区域。该研究主要采用先进的扬声器识别模型,包括 ECAPA-TDNN 和 ResNet34,这些模型在扬声器验证任务中展现出卓越性能。 proposed MEP 方法在音频质量和规避效果方面均表现出强性能。能量掩码方法有效最小化了主观评价语音质量(PESQ) degradation,表明即使存在对抗性扰动,人类听者的感知失真也很小。具体而言,在 PESQ 评估中,MEP 方法的相对性能为 FGSM 和迭代 FGSM 的 26.68%。

关键词

引用

@article{arxiv.2601.22390,
  title  = {An Effective Energy Mask-based Adversarial Evasion Attacks against Misclassification in Speaker Recognition Systems},
  author = {Chanwoo Park and Chanwoo Kim},
  journal= {arXiv preprint arXiv:2601.22390},
  year   = {2026}
}