中文

SafeSpeech:面向恶意语音合成的稳健通用语音保护

声音 2025-04-15 v1 人工智能 密码学与安全 机器学习

摘要

语音合成技术带来了便利,然而逼真的深度伪造音频的广泛使用引发了风险。恶意对手可能未经授权收集受害者的语音并克隆相似的声音进行非法利用(例如,电话诈骗)。然而,现有的防御方法无法有效防止深度伪造滥用,且对稳健训练技术具有脆弱性。因此,迫切需要一种更有效且稳健的数据保护方法。为此,我们提出了防御框架SafeSpeech,通过在原始语音上嵌入不可感知的扰动来保护用户音频,防止高质量合成语音。SafeSpeech中,我们设计了一种稳健且通用的主动保护技术——Speech Perturbative Concealment (SPEC),利用替代模型为生成式合成模型生成通用适用的扰动。此外,我们优化嵌入扰动在时域和频域的人类感知。为全面评估我们的方法, 我们在多个先进模型和数据集上进行了大量实验,进行主观和客观评估。我们的实验结果表明,SafeSpeech实现了语音保护效果和可迁移性的状态最佳(SOTA),并对高级自适应对手具有高度稳健性。此外,SafeSpeech在实际测试中具有实时能力。源代码可在https://github.com/wxzyd123/SafeSpeech获取。

关键词

引用

@article{arxiv.2504.09839,
  title  = {SafeSpeech: Robust and Universal Voice Protection Against Malicious Speech Synthesis},
  author = {Zhisheng Zhang and Derui Wang and Qianyi Yang and Pengyang Huang and Junhan Pu and Yuxin Cao and Kai Ye and Jie Hao and Yixian Yang},
  journal= {arXiv preprint arXiv:2504.09839},
  year   = {2025}
}

备注

Accepted to USENIX Security 2025