VSMask:通过实时预测扰动防御语音合成攻击
声音
2023-05-11 v1 密码学与安全
音频与语音处理
摘要
基于深度学习的语音合成技术可生成类人的人工语音,已被用于深度伪造或身份盗窃攻击。现有防御机制向原始语音音频中注入细微的对抗扰动以误导语音合成模型。然而,优化对抗扰动不仅耗费大量计算时间,还需要获取完整语音。因此,它们不适用于保护实时语音流,例如语音消息或在线会议。本文中,我们提出 VSMask,一种针对语音合成攻击的实时保护机制。与离线保护方案不同,VSMask 利用预测神经网络为即将到来的流式语音预测最有效的扰动。VSMask 引入一种针对任意语音输入定制的通用扰动,以整体保护实时语音。为最小化受保护语音中的音频失真,我们实施基于权重的扰动约束以降低所添加扰动的可感知性。我们在不同场景下全面评估 VSMask 的保护性能。实验结果表明,VSMask 能有效防御 3 种流行的语音合成模型。在 VSMask 保护下,没有任何合成语音能欺骗说话人验证模型或人耳。在物理世界实验中,我们证明 VSMask 通过空中注入扰动成功保护了实时语音。
引用
@article{arxiv.2305.05736,
title = {VSMask: Defending Against Voice Synthesis Attack via Real-Time Predictive Perturbation},
author = {Yuanda Wang and Hanqing Guo and Guangjing Wang and Bocheng Chen and Qiben Yan},
journal= {arXiv preprint arXiv:2305.05736},
year = {2023}
}