中文

基于联邦声学模型的端到端语音识别

声音 2021-07-12 v2 机器学习 音频与语音处理

摘要

在联邦学习(FL)设置下训练自动语音识别(ASR)模型近来备受关注。然而,文献中常呈现的FL场景往往是人为构造的,未能捕捉真实FL系统的复杂性。在本文中,我们构建了一个具有挑战性且真实的ASR联邦实验设置,该设置由具有异构数据分布的客户端组成,使用了CommonVoice数据集的法语和意大利语子集——这是一个包含数千名不同说话人、声学环境和噪声的大型异构数据集。我们提出了首个针对基于注意力的序列到序列端到端(E2E)ASR模型的实证研究,比较了三种聚合加权策略——标准FedAvg、基于损失的聚合以及一种新颖的基于词错误率(WER)的聚合,在两种真实FL场景中进行了对比:10个客户端的跨孤岛(cross-silo)场景,以及2K和4K客户端的跨设备(cross-device)场景。我们对来自异构且真实的联邦声学模型的E2E ASR的分析,为未来基于真实FL的ASR应用的研发提供了基础。

关键词

引用

@article{arxiv.2104.14297,
  title  = {End-to-End Speech Recognition from Federated Acoustic Models},
  author = {Yan Gao and Titouan Parcollet and Salah Zaiem and Javier Fernandez-Marques and Pedro P. B. de Gusmao and Daniel J. Beutel and Nicholas D. Lane},
  journal= {arXiv preprint arXiv:2104.14297},
  year   = {2021}
}