中文

面向自动语音识别的联邦声学建模

声音 2021-02-09 v1 分布式、并行与集群计算 音频与语音处理

摘要

数据隐私与保护是任何自动语音识别(ASR)服务提供商在处理客户时面临的关键问题。本文研究利用来自多个客户端的数据进行联邦声学建模。客户端的数据存储在本地数据服务器上,客户端仅与中心服务器通信模型参数而非其数据。通信以较低频率进行以降低通信成本。为缓解非独立同分布(non-iid)问题,提出客户端自适应联邦训练(CAFT)以规范化跨客户端的数据。实验在来自多个领域的 1,150 小时语音数据上开展。通过联邦学习训练混合 LSTM 声学模型,并将其性能与传统集中式声学模型训练进行比较。实验结果表明所提出的联邦声学建模策略的有效性。我们还表明 CAFT 能进一步提升联邦声学模型的性能。

关键词

引用

@article{arxiv.2102.04429,
  title  = {Federated Acoustic Modeling For Automatic Speech Recognition},
  author = {Xiaodong Cui and Songtao Lu and Brian Kingsbury},
  journal= {arXiv preprint arXiv:2102.04429},
  year   = {2021}
}

备注

Accepted by ICASSP 2021