RoVo:针对未授权语音合成的鲁棒语音保护
机器学习
2025-05-20 v1 声音
音频与语音处理
摘要
随着深度语音合成技术如Deep Voice等AI技术的发展,语音欺骗攻击,包括语音钓鱼和虚假新闻,通过未经授权地使用他人语音而日益增加。现有方法通过注入音频信号中的对抗性扰动来防御,但效果有限,因为这些扰动容易被语音增强方法中和。为克服这一限制,我们提出RoVo(Robust Voice),一种新的主动防御技术,通过注入语音信号高维嵌入向量中的对抗性扰动来实现语音重构,从而获得受保护的语音。这一方法有效抵御语音合成攻击,也能抵御代表二次攻击威胁的语音增强模型。在广泛的实验中,RoVo相较于未受保护语音将防御成功率(DSR)提高了70%以上,涵盖四种最先进的语音合成模型。具体而言,RoVo在商业说话人验证API上实现了99.5%的DSR,有效中和了语音合成攻击。此外,RoVo的扰动即使在强语音增强条件下仍保持鲁棒性,优于传统方法。用户研究确认,RoVo在保持受保护语音的自然度和可用性方面表现良好,凸显了其在复杂和不断演变的威胁情景下的有效性。
引用
@article{arxiv.2505.12686,
title = {RoVo: Robust Voice Protection Against Unauthorized Speech Synthesis with Embedding-Level Perturbations},
author = {Seungmin Kim and Sohee Park and Donghyun Kim and Jisu Lee and Daeseon Choi},
journal= {arXiv preprint arXiv:2505.12686},
year = {2025}
}