面向自动语音识别的联邦表示学习
声音
2023-08-09 v2 计算与语言
机器学习
音频与语音处理
摘要
联邦学习(FL)是一种保护隐私的范式,允许边缘设备在不共享数据的情况下协同学习。像 Alexa 和 Siri 这样的边缘设备是未标注音频数据的潜在来源,可用于学习鲁棒的音频表示。在这项工作中,我们将自监督学习(SSL)与 FL 结合,在尊重数据隐私约束下学习用于自动语音识别的表示。我们利用未标注语音数据集 Libri-Light 中的说话人与章节信息来模拟非独立同分布的设备孤岛数据分布,并使用 FedSGD 在对比预测编码框架下预训练一个 LSTM 编码器。我们表明,FL 中预训练的 ASR 编码器表现与集中式预训练模型相当,且相比无预训练在词错误率(WER)上提升 12-15%。我们进一步将联邦预训练模型适配到一门新语言——法语,并显示出相比无预训练 20% (WER) 的提升。
引用
@article{arxiv.2308.02013,
title = {Federated Representation Learning for Automatic Speech Recognition},
author = {Guruprasad V Ramesh and Gopinath Chennupati and Milind Rao and Anit Kumar Sahu and Ariya Rastrow and Jasha Droppo},
journal= {arXiv preprint arXiv:2308.02013},
year = {2023}
}
备注
Accepted at ISCA SPSC Symposium 3rd Symposium on Security and Privacy in Speech Communication, 2023