面向自动语音识别的联邦声学建模
声音
2021-02-09 v1 分布式、并行与集群计算
音频与语音处理
摘要
数据隐私与保护是任何自动语音识别(ASR)服务提供商在处理客户时面临的关键问题。本文研究利用来自多个客户端的数据进行联邦声学建模。客户端的数据存储在本地数据服务器上,客户端仅与中心服务器通信模型参数而非其数据。通信以较低频率进行以降低通信成本。为缓解非独立同分布(non-iid)问题,提出客户端自适应联邦训练(CAFT)以规范化跨客户端的数据。实验在来自多个领域的 1,150 小时语音数据上开展。通过联邦学习训练混合 LSTM 声学模型,并将其性能与传统集中式声学模型训练进行比较。实验结果表明所提出的联邦声学建模策略的有效性。我们还表明 CAFT 能进一步提升联邦声学模型的性能。
引用
@article{arxiv.2102.04429,
title = {Federated Acoustic Modeling For Automatic Speech Recognition},
author = {Xiaodong Cui and Songtao Lu and Brian Kingsbury},
journal= {arXiv preprint arXiv:2102.04429},
year = {2021}
}
备注
Accepted by ICASSP 2021