教师集成隐私聚合学习用于端到端语音识别的实验研究
声音
2022-10-17 v2 机器学习
神经与进化计算
音频与语音处理
摘要
差分隐私(DP)是一种数据保护途径,通过对隐私数据施加噪声扰动来保障用于训练深度模型的用户信息。为满足隐私预算 ,这种噪声扰动常导致自动语音识别(ASR)性能严重下降。教师集成隐私聚合(PATE)利用集成概率,在应对由小 值控制的噪声效应时提升 ASR 准确率。我们将 PATE 学习扩展至动态模式即语音语句,并首次通过实验证明其可防止 ASR 训练中的声学数据泄露。我们在开源 LibriSpeech 和 TIMIT 语料库上评估了三种端到端深度模型,包括 LAS、混合 CTC/attention 和 RNN transducer。经 PATE 学习增强的 ASR 模型优于基准 DP-SGD 机制,尤其在严格 DP 预算下,对于使用 LibriSpeech 评估的 RNN transducer 模型,相对词错率降低介于 26.2% 与 27.5% 之间。我们还提出了一种在公共语音语料库上预训练的保 DP ASR 方案。
引用
@article{arxiv.2210.05614,
title = {An Experimental Study on Private Aggregation of Teacher Ensemble Learning for End-to-End Speech Recognition},
author = {Chao-Han Huck Yang and I-Fan Chen and Andreas Stolcke and Sabato Marco Siniscalchi and Chin-Hui Lee},
journal= {arXiv preprint arXiv:2210.05614},
year = {2022}
}
备注
5 pages. Accepted to IEEE SLT 2022. A first version draft was finished in Aug 2021