中文

FedNST:用于自动语音识别的联邦噪声学生训练

音频与语音处理 2022-07-14 v2 人工智能 计算与语言 计算机视觉与模式识别 分布式、并行与集群计算 机器学习

摘要

联邦学习(FL)能够在分布式系统中的用户设备(客户端)上训练最先进的自动语音识别(ASR)模型,从而防止将原始用户数据传输到中央服务器。FL 用于 ASR 实际落地的一个关键挑战是在客户端获取真实标签。现有方法依赖客户端手动转写其语音,这对于获取大型训练语料库而言不切实际。一个有前景的替代方案是使用半监督/自监督学习方法来利用未标记的用户数据。为此,我们提出了 FedNST,一种利用私有且未标记的用户数据训练分布式 ASR 模型的新方法。我们探索了 FedNST 的各个方面,例如使用不同比例的标记和未标记数据训练模型,并在 1173 个模拟客户端上评估所提出的方法。在 LibriSpeech 上评估 FedNST,其中 960 小时语音数据被均分为服务器(已标记)和客户端(未标记)数据,结果显示相对于仅在服务器数据上训练的监督基线,词错误率相对降低了 22.5%(WERR)。

关键词

引用

@article{arxiv.2206.02797,
  title  = {FedNST: Federated Noisy Student Training for Automatic Speech Recognition},
  author = {Haaris Mehmood and Agnieszka Dobrowolska and Karthikeyan Saravanan and Mete Ozay},
  journal= {arXiv preprint arXiv:2206.02797},
  year   = {2022}
}

备注

Accepted at Interspeech 2022