在非独立同分布数据上通过联邦学习训练关键词 spotting 模型
音频与语音处理
2020-06-05 v2 计算与语言
机器学习
声音
摘要
我们证明了可以使用联邦学习在设备端训练出生产质量的关键词 spotting 模型,并取得与集中训练模型相当的误接受率和误拒绝率。为克服与设备端数据拟合相关的算法约束(这些数据天然是非独立同分布的),我们利用大规模联邦仿真对优化算法和超参数配置进行了详尽的实证研究。为克服资源约束,我们用 SpecAugment 替代了内存密集的 MTR 数据增强,将误拒绝率降低了56%。最后,为标注样本(鉴于对设备端数据零可见性),我们探索了教师-学生训练。
引用
@article{arxiv.2005.10406,
title = {Training Keyword Spotting Models on Non-IID Data with Federated Learning},
author = {Andrew Hard and Kurt Partridge and Cameron Nguyen and Niranjan Subrahmanya and Aishanee Shah and Pai Zhu and Ignacio Lopez Moreno and Rajiv Mathews},
journal= {arXiv preprint arXiv:2005.10406},
year = {2020}
}
备注
Submitted to Interspeech 2020