半监督深度学习算法在音频分类中的比较
摘要
在本文中,我们将五种近期半监督学习(SSL)方法适配于音频分类任务。前两种方法,即深度协同训练(DCT)和 Mean Teacher(MT),涉及两个协作神经网络。其余三种算法称为 MixMatch(MM)、ReMixMatch(RMM)和 FixMatch(FM),是主要依赖数据增强策略的单模型方法。我们在所有实验中采用 Wide-ResNet-28-2 架构,以 10% 标注数据和剩余 90% 未标注数据进行训练,首先在三个标准基准音频数据集上比较五种方法的错误率:环境声音分类(ESC-10)、UrbanSound8K(UBS8K)和 Google Speech Commands(GSC)。除一种情况外,MM、RMM 和 FM 均显著优于 MT 和 DCT,且 MM 和 RMM 在大多数实验中为最佳方法。在 UBS8K 和 GSC 上,MM 分别取得 18.02% 和 3.25% 的错误率(ER),优于以 100% 可用标注数据训练的模型(其分别为 23.29% 和 4.94%)。RMM 在 ESC-10 上取得最佳结果(12.00% ER),其次 FM 达到 13.33%。其次,我们探索将 MM 和 RMM 中使用的 mixup 增强添加至 DCT、MT 和 FM。几乎所有情况下,mixup 均带来稳定提升。例如,在 GSC 上,FM 无 mixup 和有 mixup 分别达到 4.44% 和 3.31% 的 ER。我们的 PyTorch 代码将在论文录用后于 https://github.com/Labbe ti/SSLH 公开。
引用
@article{arxiv.2102.08183,
title = {Comparison of semi-supervised deep learning algorithms for audio classification},
author = {Léo Cances and Etienne Labbé and Thomas Pellegrini},
journal= {arXiv preprint arXiv:2102.08183},
year = {2023}
}
备注
9 pages, 5 figures, 5 tables. This is the version 3 of the paper. Contains minor fixes compared to the EURASIP one (which is the version 2 of the paper)