少样本音频分类的研究
音频与语音处理
2020-12-04 v1 神经与进化计算
声音
摘要
深度学习的进展已使许多音频分类任务取得最先进性能,但与人类不同,这些系统传统上需要大量数据才能做出准确预测。并非每个个人或组织都能获取那些资源,而能获取资源的组织(如我们整个领域)并未反映我国的人口统计特征。使人们在无显著资源障碍下使用机器学习十分重要,因为机器学习是日益有用的解题工具,且在更广泛人群手中时可解决更广泛的问题。少样本学习是一类旨在使模型以极少样本泛化到新类别的机器学习。在本研究中,我们采用原型网络(Prototypical Network)少样本学习算法处理两项音频分类任务(说话人识别与活动分类),并评估多种编码器架构的性能。我们的编码器包括循环神经网络以及一维和二维卷积神经网络。我们在 VoxCeleb 数据集与 ICSI Meeting Corpus 上评估说话人识别模型,分别取得 93.5% 与 54.0% 的 5-shot 5-way 准确率。我们还使用取自 Youtube 视频的 Kinetics~600 数据集与 AudioSet 的少样本子集评估基于音频的活动分类,分别取得 51.5% 与 35.2% 的准确率。
引用
@article{arxiv.2012.01573,
title = {A Study of Few-Shot Audio Classification},
author = {Piper Wolters and Chris Careaga and Brian Hutchinson and Lauren Phillips},
journal= {arXiv preprint arXiv:2012.01573},
year = {2020}
}
备注
Presented at GHC 2020