用于声学事件检测的深度卷积神经网络与数据增强
声音
2016-12-09 v2 多媒体
摘要
我们提出了一种用于声学事件检测(AED)的新方法。与语音不同,来自声学事件的声音可能由多种来源产生。此外,由于缺乏清晰的子词单元,区分它们通常需要分析较长的时间段。为了将长时间频率结构纳入AED,我们引入了具有大输入场的卷积神经网络(CNN)。与先前工作相比,这使得能够端到端训练音频事件检测。我们的架构受VGGNet成功的启发,使用小的3x3卷积,但比AED中先前方法具有更深的深度。为了防止过拟合并充分利用我们网络的建模能力,我们进一步提出了一种新颖的数据增强方法来引入数据变化。实验结果表明,我们的CNN显著优于包括词袋音频(BoAW)和经典CNN在内的现有最优方法,实现了16%的绝对提升。
引用
@article{arxiv.1604.07160,
title = {Deep Convolutional Neural Networks and Data Augmentation for Acoustic Event Detection},
author = {Naoya Takahashi and Michael Gygli and Beat Pfister and Luc Van Gool},
journal= {arXiv preprint arXiv:1604.07160},
year = {2016}
}
备注
Presented in INTERSPEECH 2016