中文

用于隐私语音生成的对抗表示学习

音频与语音处理 2020-06-18 v2 机器学习 声音

摘要

随着组织、公司和国家在各种环境中收集的数据越来越多,对用户隐私的需求也在增加。因此,开发用于数据分析的隐私保护方法是一个重要的研究领域。在这项工作中,我们提出一个基于生成对抗网络(GAN)的模型,该模型学习掩盖语音数据中的特定敏感属性。我们训练一个模型,学习隐藏数据中的敏感信息,同时保留话语中的语义。该模型分两步训练:首先在谱图域中过滤敏感信息,然后生成独立于被过滤信息的新私有信息。该模型基于以梅尔谱图为输入的 U-Net CNN。使用 MelGAN 将谱图反演回原始音频波形。我们表明,可以通过生成新数据来隐藏诸如性别等敏感信息,并以对抗方式训练以维持效用与真实感。

关键词

引用

@article{arxiv.2006.09114,
  title  = {Adversarial representation learning for private speech generation},
  author = {David Ericsson and Adam Östberg and Edvin Listo Zec and John Martinsson and Olof Mogren},
  journal= {arXiv preprint arXiv:2006.09114},
  year   = {2020}
}

备注

Submitted to ICML 2020 Workshop on Self-supervision in Audio and Speech (SAS)