中文

用于属性驱动隐私保护的说话人表示的对抗解耦

音频与语音处理 2021-06-17 v3 人工智能 密码学与安全

摘要

在语音技术中,说话人声音表示被用于诸多应用,如语音识别、语音转换、语音合成以及显然的用户认证。现代说话人的声学表示基于神经嵌入。除目标信息外,这些表示通常包含说话人的敏感信息,如年龄、性别、身体状态、教育水平或种族。为使用户能够选择保护哪些信息,我们在本文中引入说话人声音表示中属性驱动隐私保护的概念。它允许个人对一个潜在的恶意拦截者及应用提供者隐藏一个或多个个人特征。作为该概念的首个解决方案,我们提出使用对抗自编码方法,在声音表示中解耦给定说话人属性从而使其可被隐藏。我们在此聚焦于自动说话人验证(ASV)任务中的性别属性。使用 VoxCeleb 数据集进行的实验表明,所提方法能够在保持 ASV 能力的同时实现该属性的隐藏。

关键词

引用

@article{arxiv.2012.04454,
  title  = {Adversarial Disentanglement of Speaker Representation for Attribute-Driven Privacy Preservation},
  author = {Paul-Gauthier Noé and Mohammad Mohammadamini and Driss Matrouf and Titouan Parcollet and Andreas Nautsch and Jean-François Bonastre},
  journal= {arXiv preprint arXiv:2012.04454},
  year   = {2021}
}

备注

Accepted to Interspeech 2021