ASR中隐私保护的对抗表示学习:现实还是假象?
计算与语言
2019-11-13 v1 机器学习
摘要
自动语音识别(ASR)是许多服务与应用中的关键技术。这通常要求用户设备将其语音数据发送至云端进行ASR解码。由于语音信号携带大量说话人信息,这引发了严重的隐私担忧。作为一种解决方案,可在每个用户设备上放置编码器,进行本地计算以匿名化表示。本文关注说话人身份的保护,并研究基于经ASR训练的深度编码器-解码器架构所获得的编码语音表示,能在多大程度上识别用户。通过在Librispeech语料库上进行的开集与闭集说话人识别与验证实验,我们表明标准架构获得的表示仍携带大量说话人身份信息。我们随后提出使用对抗训练来学习在ASR中表现良好同时隐藏说话人身份的表示。我们的结果表明,对抗训练大幅降低了闭集分类准确率,但这并未转化为开集验证错误率的提升,因而并未在实践中增强对说话人身份的保护。我们提出了这一负面结果背后的若干可能原因。
引用
@article{arxiv.1911.04913,
title = {Privacy-Preserving Adversarial Representation Learning in ASR: Reality or Illusion?},
author = {Brij Mohan Lal Srivastava and Aurélien Bellet and Marc Tommasi and Emmanuel Vincent},
journal= {arXiv preprint arXiv:1911.04913},
year = {2019}
}