中文

基于灵活位置梯度反转层的 ASR 声学嵌入端侧说话人匿名化

音频与语音处理 2023-07-26 v1 密码学与安全 声音

摘要

由大规模AI模型提供服务的智能设备需要将用户数据传输至云端进行推理。对于语音应用而言,这意味着传输私有的用户信息,例如说话人身份。本文提出一种隐私增强框架,旨在实现说话人身份匿名化,同时为我们下游任务——自动语音识别(ASR)——保持识别准确率。该框架将基于灵活梯度反转的说话人对抗层附加到ASR模型内的目标层,通过说话人对抗训练将目标层生成的声学嵌入匿名化以去除说话人身份。我们提出通过执行ASR模型的初始层实现端侧部署,并将匿名化嵌入传输至云端,在云端执行模型其余部分的同时保护隐私。实验结果表明,我们的方法将说话人识别相对准确率有效降低33%,并通过实现6.2%的相对词错误率(WER)下降提升了ASR性能。

关键词

引用

@article{arxiv.2307.13343,
  title  = {On-Device Speaker Anonymization of Acoustic Embeddings for ASR based onFlexible Location Gradient Reversal Layer},
  author = {Md Asif Jalal and Pablo Peso Parada and Jisi Zhang and Karthikeyan Saravanan and Mete Ozay and Myoungji Han and Jung In Lee and Seokyeong Jung},
  journal= {arXiv preprint arXiv:2307.13343},
  year   = {2023}
}

备注

Proceedings of INTERSPEECH 2023