VocalBridge:用于击败基于扰动的声纹防御的潜在扩散-桥接净化
声音
2026-01-07 v1 人工智能
密码学与安全
机器学习
音频与语音处理
摘要
语音合成技术的快速发展,包括文本语音(TTS)和语音转换(VC),加剧了与语音克隆相关的安全和隐私担忧。最近的防御方法通过嵌入保护性扰动到语音中,以隐藏说话人身份而保持语音可理解性。然而,对手可以应用先进的净化技术来移除这些扰动、恢复真实声学特征并再生生成可克隆的语音。尽管此类攻击的逼真度不断提升,但针对自适应净化的现有防御鲁棒性仍不足。大多数现有净化方法是针对自动语音识别(ASR)系统的对抗噪声而非说话人验证或语音克隆管线设计的,因此无法抑制定义说话人身份的细粒度声学线索,常对说话人验证攻击(SVA)无效。为解决这些限制,我们提出了Diffusion-Bridge(VocalBridge),一种学习从扰动语音到干净语音在EnCodec潜在空间中的映射的净化框架。使用基于余弦噪声计划的时间条件1D U-Net,模型实现了高效、无需转录的净化,同时保留说话人判别结构。我们进一步引入了基于Whisper引导的音素变体,集成轻量级的时间引导而无需真实转录。实验结果表明,我们的方法在从受保护语音中恢复可克隆语音方面 consistently优于现有净化方法。我们的发现表明当前基于扰动的防御脆弱,凸显了针对不断演化的语音克隆和说话人验证威胁需要更健壮的保护机制。
引用
@article{arxiv.2601.02444,
title = {VocalBridge: Latent Diffusion-Bridge Purification for Defeating Perturbation-Based Voiceprint Defenses},
author = {Maryam Abbasihafshejani and AHM Nazmus Sakib and Murtuza Jadliwala},
journal= {arXiv preprint arXiv:2601.02444},
year = {2026}
}