基于深度循环神经网络的音频场景分类
声音
2017-06-06 v2 机器学习
摘要
我们在本工作中提出了一种利用深度循环神经网络进行音频场景分类的高效方法。首先将音频场景转换为高层标签树嵌入特征向量序列。然后将该向量序列划分为多个子序列,在每个子序列上训练一个基于 GRU 的深度循环神经网络以进行序列到标签的分类。最后通过聚合子序列分类输出得到整个序列的全局预测标签。我们将展示我们的方法在 LITIS Rouen 数据集上获得了 97.7% 的 F1 分数,该数据集是此任务公开可用的最大数据集。与该数据集上之前报道的最佳结果相比,我们的方法能够将相对分类错误率降低 35.3%。
引用
@article{arxiv.1703.04770,
title = {Audio Scene Classification with Deep Recurrent Neural Networks},
author = {Huy Phan and Philipp Koch and Fabrice Katzberg and Marco Maass and Radoslaw Mazur and Alfred Mertins},
journal= {arXiv preprint arXiv:1703.04770},
year = {2017}
}
备注
Accepted for Interspeech 2017