中文

一种在分布式 ASR 训练中揭示说话人身份的方法及其对策

计算与语言 2021-04-19 v1 密码学与安全 机器学习

摘要

端到端自动语音识别(ASR)模型通常使用随机梯度下降(SGD)等优化方法在语音语句上训练。在联邦学习等分布式环境中,模型训练需要通过网络传输梯度。在本工作中,我们设计了第一种仅通过梯度即可揭示训练语句说话人身份的方法。我们提出无 Hessian 梯度匹配,一种无需损失函数二阶导数(先前工作所需,计算代价可能很高)的输入重建技术。我们使用 DeepSpeech 模型架构展示了方法的有效性,表明在 LibriSpeech 数据集上以 34% 的 top-1 准确率(51% 的 top-5 准确率)揭示说话人身份是可行的。此外,我们研究了两种知名技术——差分隐私 SGD 和 Dropout——对我们方法成功率的影响。我们表明,0.2 的 dropout 率可将说话人身份准确率降至 0% top-1(0.5% top-5)。

关键词

引用

@article{arxiv.2104.07815,
  title  = {A Method to Reveal Speaker Identity in Distributed ASR Training, and How to Counter It},
  author = {Trung Dang and Om Thakkar and Swaroop Ramaswamy and Rajiv Mathews and Peter Chin and Françoise Beaufays},
  journal= {arXiv preprint arXiv:2104.07815},
  year   = {2021}
}