NouveauVoice: 为语音匿名化生成新颖的伪说话人
音频与语音处理
2026-07-04 v1 人工智能
摘要
语音合成和语音转换 (VC) 中的先进神经技术给个人隐私带来了严重风险,因此需要强大的说话人匿名化系统 (SAS)。现有的 SAS 方法在手工艺特征空间或说话人嵌入空间中修改语音特征,通常难以在生成的语音中提供足够的身份变异性。在本文中,我们提出了 NouveauVoice,一个基于分层深度变分自编码器 (NVAE) 的新颖伪说话人生成框架。作为独立插件模块集成在最先进的架构(FACodec 和 CosyVoice2)之上,我们的方法利用易处理的采样和证据下界 (ELBO) 目标来合成高度表达的伪说话人嵌入,并显著增强说话人多样性。在与 VoicePrivacy Challenge 类似的协议下评估我们的框架,并结合最大均值差异 (MMD) 分析,我们证明 NouveauVoice 实现了强大的身份隐藏,针对自动说话人验证攻击模型的等错误率 (EER) 超过 38%。我们的系统在严格匿名性、丰富的伪说话人多样性和下游语音实用性(如可懂度和情感表达性)之间展示了合理的权衡。
引用
@article{arxiv.2607.03985,
title = {NouveauVoice: Generating Novel Pseudo Speakers for Voice Anonymization},
author = {Meiying Melissa Chen and Anastasia Kuznetsova and Zhenyu Wang and Zhiyao Duan},
journal= {arXiv preprint arXiv:2607.03985},
year = {2026}
}