基于 Wav2vec 2.0 的 ASR 联邦学习
音频与语音处理
2023-02-22 v1 机器学习
声音
摘要
本文提出了一项利用联邦学习训练基于自监督预训练的 wav2vec 2.0 模型的 ASR 模型的研究。我们在著名的 TED-LIUM 3 数据集上进行实验,结果表明该模型在不使用语言模型的情况下,可在官方 TED-LIUM 3 测试集上获得 10.92% 的词错误率,且不与不同用户共享任何数据。我们还根据说话人参与联邦学习的情况分析了 ASR 性能。由于联邦学习最初是出于隐私目的而提出的,我们也衡量了其保护说话人身份的能力。为此,我们利用一种基于神经网络在指示数据集上足迹的方法来分析交换模型中包含的信息。该分析按层进行,并展示了基于 wav2vec 2.0 的交换模型中哪些层带来了说话人身份信息。
引用
@article{arxiv.2302.10790,
title = {Federated Learning for ASR based on Wav2vec 2.0},
author = {Tuan Nguyen and Salima Mdhaffar and Natalia Tomashenko and Jean-François Bonastre and Yannick Estève},
journal= {arXiv preprint arXiv:2302.10790},
year = {2023}
}
备注
5 pages, accepted in ICASSP 2023