时频表示的梯度直方图用于音频场景检测
声音
2015-08-21 v1 机器学习
摘要
本文研究了音频场景分类问题,并通过提出一种新型特征为该领域的前沿做出了贡献。我们通过考虑音频场景的时频表示的梯度直方图(HOG)来构建该特征。与经典音频特征如MFCC不同,我们假设梯度直方图能够在时频表示中编码一些相关信息,即信号谱功率在时间和频率上的局部变化方向。此外,为了获得更多不变性和鲁棒性,梯度直方图在局部进行池化。我们通过将其性能与最先进竞争者进行比较,评估了该新型特征的相关性,比较在多个数据集上进行,包括我们作为贡献提供的一个新数据集。该数据集我们公开发布,涉及19个类别,包含约900分钟的音频场景录音。因此我们相信它可能成为评估音频场景分类算法的下一个标准数据集。我们的比较结果清楚地表明,基于HOG的特征优于其竞争者。
引用
@article{arxiv.1508.04909,
title = {Histogram of gradients of Time-Frequency Representations for Audio scene detection},
author = {Alain Rakotomamonjy and Gilles Gasso},
journal= {arXiv preprint arXiv:1508.04909},
year = {2015}
}