利用卷积神经网络从原始波形理解音频模式
声音
2016-11-30 v1
摘要
音频信号处理的一个关键步骤是将原始信号转换为能高效编码原始信息的表示。传统上,人们将音频转换为频谱表示,作为频率、振幅和相位变换的函数。在这项工作中,我们采用纯数据驱动的方法,在原始信号层面理解音频的时间动态。我们通过一个深度卷积神经网络(CNN)模型,最大化从原始信号中提取的信息。我们的CNN模型在UrbanSound8K数据集上进行训练。我们发现,嵌入在原始波形中的显著音频模式可以通过CNN模型学习到的非线性滤波器组合被高效提取。
引用
@article{arxiv.1611.09524,
title = {Understanding Audio Pattern Using Convolutional Neural Network From Raw Waveforms},
author = {Shuhui Qu and Juncheng Li and Wei Dai and Samarjit Das},
journal= {arXiv preprint arXiv:1611.09524},
year = {2016}
}