中文

基于共振峰与基频缩放的可区分说话人匿名化

音频与语音处理 2022-11-08 v1 密码学与安全 声音

摘要

由于社交媒体的出现,互联网上的语音数据呈指数级激增,此类个人数据的共享引发了明显的安全与隐私担忧。缓解这些担忧的一种方案是在共享语音数据前隐藏说话人身份,亦称说话人匿名化。在我们此前的工作中,我们开发了无需自动说话人验证(ASV)模型的匿名化框架,以在保护说话人隐私的同时保持语音可懂度。尽管该框架在 VoicePrivacy 2022 挑战赛中排名第一,但匿名化并不完善,因为匿名化语音的说话人可区分性有所下降。为解决此问题,本文直接对共振峰分布与基频(F0)建模以表征说话人身份,并通过均匀缩放共振峰与 F0 对源语音进行匿名化。通过直接缩放共振峰与 F0,可防止由引入其他说话人所导致的匿名化语音说话人可区分性退化。实验结果表明,我们提出的框架能够提升说话人可区分性,并在语音独特性上显著优于此前的框架。此外,我们所提方法还可利用不同缩放因子权衡隐私与效用。

关键词

引用

@article{arxiv.2211.03038,
  title  = {Distinguishable Speaker Anonymization based on Formant and Fundamental Frequency Scaling},
  author = {Jixun Yao and Qing Wang and Yi Lei and Pengcheng Guo and Lei Xie and Namin Wang and Jie Liu},
  journal= {arXiv preprint arXiv:2211.03038},
  year   = {2022}
}

备注

Submitted to ICASSP 2023