中文

DeID-VC:基于零样本伪语音转换的说话人去标识

声音 2022-09-13 v1 人工智能 计算与语言 多媒体 音频与语音处理

摘要

基于语音的在线服务的广泛采用引发了关于其所使用与共享数据的安全性和隐私担忧。若数据遭泄露,攻击者可能利用用户语音绕过说话人验证系统甚至冒充用户。为缓解此问题,我们提出 DeID-VC,一种将真实说话人转换为伪说话人的说话人去标识系统,从而从语音中移除或混淆说话人相关属性。DeID-VC 的关键组件包括基于变分自编码器(VAE)的伪说话人生成器(PSG)和零样本设置下的语音转换自编码器(AE)。借助 PSG,DeID-VC 可在说话人级甚至语句级分配唯一伪说话人。此外,新增两个新颖学习目标以弥合零样本语音转换训练与推断间的差距。我们给出以词错误率(WER)和等错误率(EER)以及三项主观指标评估 DeID-VC 生成输出的实验结果。结果表明,相比基线,我们的方法显著提升了可懂度(WER 降低 10%)与去标识有效性(EER 提高 5%)。代码与试听演示:https://github.com/a43992899/DeID-VC

关键词

引用

@article{arxiv.2209.04530,
  title  = {DeID-VC: Speaker De-identification via Zero-shot Pseudo Voice Conversion},
  author = {Ruibin Yuan and Yuxuan Wu and Jacob Li and Jaxter Kim},
  journal= {arXiv preprint arXiv:2209.04530},
  year   = {2022}
}

备注

Accepted by Interspeech 2022