中文

VoiceCloak:针对未授权扩散式语音克隆的多维防御框架

声音 2025-12-10 v5 人工智能 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

扩散模型(DM)在真实语音克隆(VC)中取得显著进展,同时也增加了恶意滥用风险。现有针对传统 VC 模型的主动防御旨在 disrupt 伪造过程,但因扩散的复杂生成机制,已被证明不适用于 DM。为填补这一差距,我们引入 VoiceCloak,一个多维主动防御框架,旨在混淆说话人身份并降低感知质量以防御未授权 VC。为实现这些目标,我们进行了针对 DM 特定漏洞的聚焦分析,使 VoiceCloak 能够通过引入对抗性扰动来 disrupt 克隆过程。具体而言,为混淆说话人身份,VoiceCloak 首先针对说话人身份进行干扰,通过扭曲表示学习嵌入来最大化身份变化,这由听觉感知原则指导。此外,VoiceCloak disrupts crucial conditional guidance processes,尤其是注意力上下文,从而防止关键生物特征特征的对齐,以实现令人信服的克隆。随后,为解决第二个目标,VoiceCloak 引入得分幅度放大,以主动引导逆向轨迹远离高质量语音生成。噪声引导的语义破坏进一步用于 disrupt DM 捕获的结构化语音语义,降低输出质量。大量实验表明,VoiceCloak 在防御未授权扩散式语音克隆方面表现出卓越的防御成功率。VoiceCloak 的音频样本可在 https://voice-cloak.github.io/VoiceCloak/ 查看。

关键词

引用

@article{arxiv.2505.12332,
  title  = {VoiceCloak: A Multi-Dimensional Defense Framework against Unauthorized Diffusion-based Voice Cloning},
  author = {Qianyue Hu and Junyan Wu and Wei Lu and Xiangyang Luo},
  journal= {arXiv preprint arXiv:2505.12332},
  year   = {2025}
}

备注

15 pages, 6 figures, 13 tables; Accepted by AAAI 2026