面向语音保护的未授权语音合成缓解技术
声音
2024-10-29 v1 人工智能
机器学习
音频与语音处理
摘要
近年来,仅需少量语音样本即可完美复制说话人的声音,而恶意的语音滥用(例如,为谋取非法经济利益的电信诈骗)给我们的日常生活带来了巨大危害。因此,保护包含敏感信息(如个人声纹)的公开可访问语音数据至关重要。以往的大多数防御方法侧重于在音色相似度上欺骗说话人验证系统,但合成的深度伪造语音仍具有高质量。针对日益严重的危害,我们设计了一种有效、可迁移且鲁棒的主动保护技术,名为关键目标扰动(POP),它在原始语音样本上施加不可察觉的误差最小化噪声,以防止其被文本到语音(TTS)合成模型有效学习,从而无法生成高质量的深度伪造语音。我们在最先进的(SOTA)TTS 模型上进行了广泛实验,利用客观和主观指标全面评估了所提出的方法。实验结果表明,该方法在各种模型上表现出卓越的有效性和可迁移性。与在未受保护样本上训练的语音合成器产生的 21.94% 的语音不清晰度评分相比,受 POP 保护的样本将其显著提高至 127.31%。此外,我们的方法对降噪和数据增强技术表现出鲁棒性,从而大大降低了潜在危害。
引用
@article{arxiv.2410.20742,
title = {Mitigating Unauthorized Speech Synthesis for Voice Protection},
author = {Zhisheng Zhang and Qianyi Yang and Derui Wang and Pengyang Huang and Yuxin Cao and Kai Ye and Jie Hao},
journal= {arXiv preprint arXiv:2410.20742},
year = {2024}
}
备注
Accepted to ACM CCS Workshop (LAMPS) 2024