中文

针对零样本语音克隆的通用扰动框架 CloneShield

声音 2025-05-27 v1 人工智能 音频与语音处理

摘要

近期文本语音(TTS)语音克隆的突破引发了严重的隐私担忧,使得仅凭几秒钟的参考音频即可实现高度精确的声学身份复制,同时保留说话者的声学真实性。本文引入 CloneShield,一个专为防御零样本语音克隆而设计的通用时域对抗扰动框架。我们的方法在说话者和语料上保持鲁健性,无需对合成文本进行任何先验知识。我们将扰动生成表述为多目标优化问题,提出多梯度下降算法(MGDA)以确保在多样化语料上的鲁健性。为保持用户的自然听觉感知,我们通过梅尔频谱表示分解对抗扰动并对每个样本进行微调。该设计既确保不可感知性,又在零样本克隆输出上保持强大的降噪效果。在三个最先进的零样本 TTS 系统、五个基准数据集和 60 位人类听者的评估中显示,我们的方法在受保护输入上保持接近原音的音质(PESQ = 3.90, SRS = 0.93),同时在克隆样本中显著降低说话者相似度和语音质量(PESQ = 1.07, SRS = 0.08)。

关键词

引用

@article{arxiv.2505.19119,
  title  = {CloneShield: A Framework for Universal Perturbation Against Zero-Shot Voice Cloning},
  author = {Renyuan Li and Zhibo Liang and Haichuan Zhang and Tianyu Shi and Zhiyuan Cheng and Jia Shi and Carl Yang and Mingjie Tang},
  journal= {arXiv preprint arXiv:2505.19119},
  year   = {2025}
}

备注

10pages, 4figures