面向生产LLM基端到端语音合成的对抗防御-E2E-VGuard
声音
2025-11-11 v1 人工智能
密码学与安全
机器学习
摘要
近期语音合成技术的进步丰富了我们的日常生活,高质量且逼真的音频广泛应用于真实世界的应用中。然而,恶意利用(如声纹克隆欺诈)也带来了严重的安全风险。现有的防御技术难以应对基于大型语言模型(LLM)的生产语音合成。虽然先前的研究考虑了针对微调合成器的保护,但假设存在手动标注的转录文本。鉴于手动标注的劳动强度,利用自动语音识别(ASR)生成转录文本的端到端(E2E)系统正变得越来越流行,例如通过商业API进行声纹克隆。因此,这种E2E语音合成也需要新的安全机制。为此,我们提出E2E-VGuard,一种针对两种新兴威胁的主动防御框架:(1)生产LLM基端到端语音合成,(2)源于ASR驱动E2E情景的新型攻击。具体而言,我们采用编码器集成搭配特征提取器来保护时长,而ASR面向攻击的对抗样本则干扰发音。此外,我们融合了声学模型以确保扰动的不可感知性。为进行全面评估,我们测试了16个开源合成器和3个商业API,覆盖中文和英文数据集,确认E2E-VGuard在时长和发音保护方面的有效性。还进行了实际部署验证。我们的代码和演示页面已公开 https://wxzyd123.github.io/e2e-vguard/。
引用
@article{arxiv.2511.07099,
title = {E2E-VGuard: Adversarial Prevention for Production LLM-based End-To-End Speech Synthesis},
author = {Zhisheng Zhang and Derui Wang and Yifan Mi and Zhiyong Wu and Jie Gao and Yuxin Cao and Kai Ye and Minhui Xue and Jie Hao},
journal= {arXiv preprint arXiv:2511.07099},
year = {2025}
}
备注
Accepted to NeurIPS 2025