DCASE 2017任务1:使用平移不变核与随机特征的声学场景分类
声音
2018-01-10 v1 音频与语音处理
摘要
声学场景录音由不同类型的手工设计或神经网络派生特征表示。这些通常具有数千维的特征,在最先进的分类方法中通过使用核机器(如支持向量机(SVM))进行分类。然而,这些方法的训练复杂度随输入特征的维数以及数据集大小而增加。一种解决方案是将输入特征映射至随机化的低维特征空间。所得的随机特征可通过更快的线性核计算来近似非线性核。在本工作中,我们计算了一组6,553维输入特征,并用其计算随机特征以近似三类核:高斯、拉普拉斯和柯西。我们在DCASE任务1——声学场景分类的背景下,使用SVM比较了它们的性能。实验表明,输入特征与随机特征均以绝对4%的优势超越了DCASE基线。此外,随机特征将输入维数缩减了三倍以上且性能损失极小,缩减六倍以上时仍优于基线。因此,随机特征可被最先进的方法采用以计算低存储特征并执行更快的核计算。
引用
@article{arxiv.1801.02690,
title = {DCASE 2017 Task 1: Acoustic Scene Classification Using Shift-Invariant Kernels and Random Features},
author = {Abelino Jimenez and Benjamin Elizalde and Bhiksha Raj},
journal= {arXiv preprint arXiv:1801.02690},
year = {2018}
}