联邦自监督语音表示:我们实现了吗?
声音
2022-07-21 v2 机器学习
音频与语音处理
摘要
麦克风设备的普及导致边缘设备产生了大量未标记的音频数据。将自监督学习(SSL)和联邦学习(FL)整合到一个连贯的系统中,有可能提供数据隐私保证,同时提高语音表示的质量和鲁棒性。在本文中,我们首次从算法、硬件和系统限制的角度,系统研究了在联邦学习场景下训练语音SSL模型的可行性和复杂性。尽管它们的组合潜力巨大,但我们发现现有的系统约束和算法行为使得SSL和FL系统几乎无法在今天构建。然而,关键的是,我们的结果指出了具体的性能瓶颈和研究机会,这些可以扭转这一局面。虽然我们的分析表明,鉴于现有的硬件趋势,混合SSL和FL语音系统要到2027年才能可行。但我们相信这项研究可以作为加速实现这一里程碑的路线图。
引用
@article{arxiv.2204.02804,
title = {Federated Self-supervised Speech Representations: Are We There Yet?},
author = {Yan Gao and Javier Fernandez-Marques and Titouan Parcollet and Abhinav Mehrotra and Nicholas D. Lane},
journal= {arXiv preprint arXiv:2204.02804},
year = {2022}
}