SwishNet:一种用于语音、音乐与噪声分类及分割的快速卷积神经网络
机器学习
2018-12-04 v1 声音
音频与语音处理
机器学习
摘要
语音、音乐与噪声的分类/分割是音频处理与索引的一项重要预处理步骤。为此,我们提出了一种新颖的一维卷积神经网络(CNN)——SwishNet。它是一种快速且轻量的架构,在 MFCC 特征上运行,适合添加到音频处理流水线的前端。我们表明,通过从在 ImageNet 上预训练的二维 CNN 中蒸馏知识,可以提升我们网络的性能。我们研究了我们的网络在 MUSAN 语料库上的性能——这是一个公开可用的、包含噪声、音乐和语音样本的全面集合,适用于深度学习。所提出的网络在片段(长度 0.5–2 秒)分类(>97% 准确率)和逐帧分割(>93% 准确率)任务中取得了很高的总体准确率,在语音/非语音判别任务中准确率更高(>99%)。为验证我们模型的鲁棒性,我们在 MUSAN 上训练并在另一不同语料库 GTZAN 上评估,发现仅需极少微调即可获得良好准确率。我们还展示了我们的模型在 CPU 和 GPU 上均运行快速、内存消耗低,并适合在嵌入式系统中实现。
引用
@article{arxiv.1812.00149,
title = {SwishNet: A Fast Convolutional Neural Network for Speech, Music and Noise Classification and Segmentation},
author = {Md. Shamim Hussain and Mohammad Ariful Haque},
journal= {arXiv preprint arXiv:1812.00149},
year = {2018}
}
备注
7 pages, 3 figures, 6 tables