中文

用于语音识别的弱监督联邦自学习

音频与语音处理 2023-06-22 v1 声音

摘要

低占用空间的自动语音识别(ASR)模型正日益部署于边缘设备上的对话代理中,这增强了隐私性。我们研究在隐私增强的端上学习方案中,循环神经网络转导器(RNN-T) ASR 模型的联邦持续增量学习问题,该方案无真实人声转录或来自更强 ASR 模型的机器转写可用。特别地,我们研究基于自学习方案的性能,其中配对教师模型通过 ASR 模型的指数移动平均更新。此外,我们提出利用可能含噪的弱监督信号,例如从用户与对话代理交互会话中多轮行为确定的反馈分数与自然语言理解语义。这些信号在多任务策略梯度训练方法中被利用,以提升 ASR 自学习的性能。最后,我们展示如何通过将端上学习与使用选定历史数据集的记忆回放方法相结合来缓解灾难性遗忘。这些创新在缺乏如真实转写等强监督信号的情况下,使新用例的 WER 相对提升 10%,且在其他测试集上退化极小。

关键词

引用

@article{arxiv.2306.12015,
  title  = {Federated Self-Learning with Weak Supervision for Speech Recognition},
  author = {Milind Rao and Gopinath Chennupati and Gautam Tiwari and Anit Kumar Sahu and Anirudh Raju and Ariya Rastrow and Jasha Droppo},
  journal= {arXiv preprint arXiv:2306.12015},
  year   = {2023}
}

备注

Proceedings of ICASSP 2023