SceneGuard:基于场景一致可感知背景噪声的训练时语音保护
声音
2025-11-21 v1
摘要
语音克隆技术通过从有限音频样本中实现未授权的语音合成,构成了重大隐私威胁。基于不可感知对抗扰动的现有防御措施易受常见音频预处理(如降噪和压缩)的攻击。我们提出 SceneGuard,一种应用场景一致可感知背景噪声的训练时语音保护方法。不同于不可感知的扰动,SceneGuard 利用自然发生的声学场景(如机场、街道、公园)创建具有情境适当性和抗对手能力的保护性噪声。我们在文本转语音训练攻击上评估了 SceneGuard,显示以极高统计显著性(p < 10^{-15}, Cohen's d = 2.18)实现 5.5% 的说话人相似度下降,同时保持 98.6% 的语音可理解性(STOI = 0.986)。鲁棒性评估表明,SceneGuard 在包括 MP3 压缩、谱减法、低通滤波和降采样在内的五种常见对手措施下,保持或提升保护效果。我们的结果表明,可感知且场景一致的噪声为训练时语音保护提供了比不可感知扰动更稳健的替代方案。源代码可在:https://github.com/richael-sang/SceneGuard 获取。
引用
@article{arxiv.2511.16114,
title = {SceneGuard: Training-Time Voice Protection with Scene-Consistent Audible Background Noise},
author = {Rui Sang and Yuxuan Liu},
journal= {arXiv preprint arXiv:2511.16114},
year = {2025}
}