V-Cloak:保持可懂度、自然度与音色的实时语音匿名化
声音
2022-10-28 v1 人工智能
密码学与安全
音频与语音处理
摘要
即时通讯或社交媒体应用产生的语音数据包含独特的用户声纹,可能被恶意对手滥用于身份推断或身份盗用。现有的语音匿名化技术,如信号处理和语音转换/合成,存在感知质量下降的问题。本文开发了一个名为 V-Cloak 的语音匿名化系统,在保持音频可懂度、自然度和音色的同时实现实时语音匿名化。我们设计的匿名器采用单样本生成模型,在不同频率层级调制原始音频的特征。我们使用精心设计的损失函数训练匿名器。除匿名损失外,我们还引入了可懂度损失和基于心理声学的自然度损失。该匿名器可实现无目标和有目标匿名化,以达到不可识别和不可链接的匿名目标。我们在四个数据集(LibriSpeech(英语)、AISHELL(中文)、CommonVoice(法语)和 CommonVoice(意大利语))、五个自动说话人验证(ASV)系统(包括两个基于 DNN、两个统计和一个商业 ASV)以及十一个自动语音识别(ASR)系统(针对不同语言)上进行了广泛实验。实验结果证实,V-Cloak 在匿名性能方面优于五个基线。我们还证明,仅在 VoxCeleb1 数据集上针对 ECAPA-TDNN ASV 和 DeepSpeech2 ASR 训练的 V-Cloak 对其他 ASV 具有可迁移的匿名性,并对其他 ASR 具有跨语言可懂度。此外,我们验证了 V-Cloak 针对各种去噪技术和自适应攻击的鲁棒性。希望 V-Cloak 能在棱镜世界中为我们提供一件斗篷。
引用
@article{arxiv.2210.15140,
title = {V-Cloak: Intelligibility-, Naturalness- & Timbre-Preserving Real-Time Voice Anonymization},
author = {Jiangyi Deng and Fei Teng and Yanjiao Chen and Xiaofu Chen and Zhaohui Wang and Wenyuan Xu},
journal= {arXiv preprint arXiv:2210.15140},
year = {2022}
}
备注
Accepted by USENIX Security Symposium 2023