少样本音频分类研究
量子物理
2021-05-07 v2
摘要
深度学习的进展使许多音频分类任务达到了最先进的性能,但与人类不同,这些系统传统上需要大量数据才能做出准确预测。并非每个个人或组织都能获取那些资源,而能获取的资源(如我们整个领域)并未反映我国的人口统计特征。使人们无需重大资源障碍即可使用机器学习十分重要,因为机器学习是日益有用的解题工具,且在更广泛的人群手中时可解决更广泛的问题。少样本学习是一类旨在使模型能以极少样本泛化到新类别的机器学习。在本研究中,我们利用原型网络(Prototypical Network)少样本学习算法处理两项音频分类任务(说话人识别与活动分类),并评估多种编码器架构的性能。我们的编码器包括循环神经网络以及一维和二维卷积神经网络。我们在 VoxCeleb 数据集与 ICSI Meeting Corpus 上评估说话人识别模型,分别取得 93.5% 与 54.0% 的 5-shot 5-way 准确率。我们还使用取自 Youtube 视频的 Kinetics~600 数据集与 AudioSet 的少样本子集评估基于音频的活动分类,分别取得 51.5% 与 35.2% 的准确率。
引用
@article{arxiv.2012.01572,
title = {General expressions for the quantum Fisher information matrix with applications to discrete quantum imaging},
author = {Lukas J. Fiderer and Tommaso Tufarelli and Samanta Piano and Gerardo Adesso},
journal= {arXiv preprint arXiv:2012.01572},
year = {2021}
}
备注
17 pages, 1 figure