中文

面向自动语音识别系统鲁棒性评估的时间风格迁移

声音 2024-05-16 v1 密码学与安全 机器学习 音频与语音处理

摘要

在自动语音识别(ASR)系统广泛应用的背景下,其安全性 concerns 受到前所未有的关注,主要由于深度神经网络的脆弱性。以前的研究表明,擅自制作对抗性扰动可被用来操控语音识别系统,导致产生恶意命令。这些攻击方法主要需要在 p\ell_p 范数约束下添加噪声扰动,不可避免地留下人工修改的痕迹。最近的研究通过操控风格向量来基于文本转语音(TTS)合成音频来合成对抗性示例,从而缓解了这一限制。然而,基于优化目标的风格修改显著降低了音频风格的可控性和可编辑性。本文提出了一种基于用户自定义风格迁移的ASR攻击方法。我们首先测试了将风格迁移攻击(STA)与对抗攻击按顺序组合的效果。然后,作为改进,我们提出了保持音频质量的迭代风格代码攻击(SCA)。实验结果表明,我们的方法能够满足用户自定义风格的需求,在攻击成功率达到82%的同时,由于我们的用户研究,保持了自然的音质。

关键词

引用

@article{arxiv.2405.09470,
  title  = {Towards Evaluating the Robustness of Automatic Speech Recognition Systems via Audio Style Transfer},
  author = {Weifei Jin and Yuxin Cao and Junjie Su and Qi Shen and Kai Ye and Derui Wang and Jie Hao and Ziyao Liu},
  journal= {arXiv preprint arXiv:2405.09470},
  year   = {2024}
}

备注

Accepted to SecTL (AsiaCCS Workshop) 2024