中文

补偿被移除的频率分量:抵御语音频谱缩减攻击

密码学与安全 2023-08-21 v1 声音 音频与语音处理

摘要

自动语音识别(ASR)为人类与机器通信提供了多样的音频转文本服务。然而,近期研究表明 ASR 系统易受各种恶意音频攻击。特别地,通过移除非必要频率分量,一种新的频谱缩减攻击可生成能被人类感知但无法被 ASR 系统正确解读的对抗性音频。这为内容审核方案在社交媒体平台可用音频和视频中检测有害内容带来了新挑战。本文中,我们提出一种名为 ACE 的声学补偿系统,以对抗针对 ASR 系统的频谱缩减攻击。我们的系统设计基于两点观察,即频率分量依赖性与扰动敏感性。首先,由于离散傅里叶变换计算不可避免地给音频频谱引入频谱泄漏和混叠效应,频率相近的分量将具有高相关性。因此,考虑到相邻频率分量间的内在依赖关系,有可能通过基于剩余分量补偿被移除分量来更多地恢复原始音频。其次,由于频谱缩减攻击中被移除的分量可视为对抗噪声的逆,当对抗音频在空口场景中重放时攻击成功率会下降。因此,我们可以对声学传播过程建模,将空口扰动加入被攻击音频。我们实现了 ACE 的原型,实验表明 ACE 可有效减少多达 87.9% 由频谱缩减攻击引起的 ASR 推理错误。此外,通过分析残差错误,我们总结了六类通用 ASR 推理错误并探究了错误原因与潜在缓解方案。

关键词

引用

@article{arxiv.2308.09546,
  title  = {Compensating Removed Frequency Components: Thwarting Voice Spectrum Reduction Attacks},
  author = {Shu Wang and Kun Sun and Qi Li},
  journal= {arXiv preprint arXiv:2308.09546},
  year   = {2023}
}

备注

Accepted by 2024 Network and Distributed System Security Symposium (NDSS'24)