面向VoicePrivacy Challenge 2020的保分布X向量生成说话人匿名化
声音
2021-01-06 v2 计算与语言
密码学与安全
音频与语音处理
摘要
在本文中,我们提出一种保分布语音匿名化技术,作为我们向VoicePrivacy Challenge 2020的提交方案。我们观察到,该挑战赛的基线系统生成的伪X向量彼此间非常相似,其相似程度远超从真实说话人提取的X向量。这种差异源于匿名化过程中对说话人池中多个X向量取平均,导致信息丢失。我们提出一种生成伪X向量的新方法,通过保持X向量的分布特性及其内部相似性来克服上述局限。我们利用群体数据学习X向量空间的性质,然后拟合一个生成模型用于采样伪X向量。我们展示了该方法生成的X向量更贴近真实说话人X向量预期的内部相似性分布。我们的方法可轻易作为系统的匿名化组件与其他方法集成,并免去了在匿名化过程中分发说话人池的需要。在注册与试验语音均被匿名化的场景下,相较于基线方案,我们的方法使等错误率(EER)在男性中最高提升、在女性中最高提升,证明了我们所生成语音的多样性。
引用
@article{arxiv.2010.13457,
title = {Speaker Anonymization with Distribution-Preserving X-Vector Generation for the VoicePrivacy Challenge 2020},
author = {Henry Turner and Giulio Lovisotto and Ivan Martinovic},
journal= {arXiv preprint arXiv:2010.13457},
year = {2021}
}
备注
5 pages Replacement: A small processing bug led to slightly incorrect results. Conclusions remain the same