中文

深度语音降噪模型对对抗性噪声具有鲁棒性吗?

声音 2026-03-12 v2 机器学习 音频与语音处理

摘要

深度噪声抑制(DNS)模型在各种高风险语音应用中得到广泛使用。然而,我们表明,通过添加心理声学上隐藏的对抗性噪声,四个近期的 DNS 模型均可以被诱导输出难以理解的胡言乱语,即使在低背景噪声和模拟的空中传输设置下也是如此。对于其中三个模型,一项由音频和多媒体专家参与的小型转录研究证实了受攻击音频的不可理解性;同时,一项 ABX 研究表明该对抗性噪声通常是难以察觉的,尽管在参与者和样本之间存在一些差异。虽然我们也确立了关于定向攻击和模型迁移的若干负面结果,但我们的结果依然凸显了在开源 DNS 系统被用于安全关键应用之前,需要采取切实可行的对策。

关键词

引用

@article{arxiv.2503.11627,
  title  = {Are Deep Speech Denoising Models Robust to Adversarial Noise?},
  author = {Will Schwarzer and Neel Chaudhari and Philip S. Thomas and Andrea Fanelli and Xiaoyu Liu},
  journal= {arXiv preprint arXiv:2503.11627},
  year   = {2026}
}

备注

22 pages, 14 figures. Related conference version accepted to ICLR 2026: see https://openreview.net/forum?id=WtH2JxKJKf