中文

联邦自训练用于半监督音频识别

机器学习 2022-02-28 v2 分布式、并行与集群计算 声音 音频与语音处理

摘要

联邦学习是一种处理去中心化与个人数据集的分布式机器学习范式。由于数据驻留在智能手机与虚拟助手等设备之上,标注被委托给客户端,或是以自动化方式提取标签。具体而言,在音频数据的情况下,获取语义标注可能极其昂贵且耗时。因此,大量音频数据在用户设备上保持未标注且未被利用。大多数现有的联邦学习方法聚焦于监督学习,未利用未标注数据。在这项工作中,我们研究通过自训练结合联邦学习进行音频模型半监督学习的问题。我们提出 FedSTAR 以利用大规模设备端未标注数据来提升音频识别模型的泛化能力。我们进一步证明,自监督预训练模型可以加速设备端模型的训练,显著改善收敛使其在更少的训练轮数内达成。我们在多个公开音频分类数据集上开展实验,并考察了我们的模型在不同标注与未标注数据比例下的性能。值得注意的是,我们表明在仅有 3% 标注数据可用时,FedSTAR 相比全监督联邦模型平均能将识别率提升 13.28%。

关键词

引用

@article{arxiv.2107.06877,
  title  = {Federated Self-Training for Semi-Supervised Audio Recognition},
  author = {Vasileios Tsouvalas and Aaqib Saeed and Tanir Ozcelebi},
  journal= {arXiv preprint arXiv:2107.06877},
  year   = {2022}
}