中文

一种基于选择性噪声扰动的语音表征匿名化框架

音频与语音处理 2022-10-31 v2 密码学与安全 声音

摘要

在将语音信号传输至自动语音识别(ASR)和语音情感识别(SER)等云服务时,隐私与安全是主要关注问题。现有的语音匿名化方案主要聚焦于语音转换或语音修改,以将原始语音转换为内容相似但身份相关信息不同或不存在的另一条语音。然而,以隐私保护表征形式共享语音数据的替代方案在很大程度上未被充分探索。本文提出一种语音匿名化框架,通过对使用预训练语音编码器提取的高效用表征中的选定子集进行噪声扰动来实现隐私保护。该子集由基于Transformer的隐私风险显著性估计器选取。我们在四项任务上验证我们的框架,即自动说话人验证(ASV)、ASR、SER和意图分类(IC),用于隐私与效用评估。实验结果表明,与VoicePrivacy2022挑战赛的语音匿名化基线相比,我们的方法能够实现具有竞争力甚至更优的效用,同时提供同等水平的隐私保护。此外,易于控制的扰动量使我们的框架无需重新训练任何组件即可拥有灵活的隐私-效用权衡范围。

关键词

引用

@article{arxiv.2203.14171,
  title  = {A Speech Representation Anonymization Framework via Selective Noise Perturbation},
  author = {Minh Tran and Mohammad Soleymani},
  journal= {arXiv preprint arXiv:2203.14171},
  year   = {2022}
}