中文

教师集成隐私聚合学习用于端到端语音识别的实验研究

声音 2022-10-17 v2 机器学习 神经与进化计算 音频与语音处理

摘要

差分隐私(DP)是一种数据保护途径,通过对隐私数据施加噪声扰动来保障用于训练深度模型的用户信息。为满足隐私预算 ε\varepsilon,这种噪声扰动常导致自动语音识别(ASR)性能严重下降。教师集成隐私聚合(PATE)利用集成概率,在应对由小 ε\varepsilon 值控制的噪声效应时提升 ASR 准确率。我们将 PATE 学习扩展至动态模式即语音语句,并首次通过实验证明其可防止 ASR 训练中的声学数据泄露。我们在开源 LibriSpeech 和 TIMIT 语料库上评估了三种端到端深度模型,包括 LAS、混合 CTC/attention 和 RNN transducer。经 PATE 学习增强的 ASR 模型优于基准 DP-SGD 机制,尤其在严格 DP 预算下,对于使用 LibriSpeech 评估的 RNN transducer 模型,相对词错率降低介于 26.2% 与 27.5% 之间。我们还提出了一种在公共语音语料库上预训练的保 DP ASR 方案。

关键词

引用

@article{arxiv.2210.05614,
  title  = {An Experimental Study on Private Aggregation of Teacher Ensemble Learning for End-to-End Speech Recognition},
  author = {Chao-Han Huck Yang and I-Fan Chen and Andreas Stolcke and Sabato Marco Siniscalchi and Chin-Hui Lee},
  journal= {arXiv preprint arXiv:2210.05614},
  year   = {2022}
}

备注

5 pages. Accepted to IEEE SLT 2022. A first version draft was finished in Aug 2021