结合原始声波与梅尔谱图高层特征进行音频标注
声音
2018-11-28 v1 机器学习
音频与语音处理
摘要
在本文中,我们描述了在DCASE 2018音频挑战赛任务2中的工作。尽管利用机器学习方法集成进行分类任务以获得更好预测性能已变得普遍,但大多数集成方法结合的是预测结果而非学习到的特征。我们提出一种单模型方法,结合由对数缩放梅尔谱图和原始音频数据计算得到的学习高层特征。这些特征分别由两个卷积神经网络(每种输入类型一个)学习,然后在单一网络内通过全连接层结合。这种相对简单的方法连同数据增强在Kaggle的Freesound通用音频标注挑战赛中排名前百分之二。
引用
@article{arxiv.1811.10708,
title = {Combining High-Level Features of Raw Audio Waves and Mel-Spectrograms for Audio Tagging},
author = {Marcel Lederle and Benjamin Wilhelm},
journal= {arXiv preprint arXiv:1811.10708},
year = {2018}
}
备注
Detection and Classification of Acoustic Scenes and Events 2018 (DCASE 2018), 19-20 November 2018, Surrey, UK