利用多尺度卷积神经网络学习环境声
声音
2018-03-29 v1 音频与语音处理
摘要
深度学习极大地提高了声音识别的性能。然而,直接从原始波形中学习声学模型仍然具有挑战性。当前基于波形的模型通常使用时域卷积层来提取特征。单一尺寸滤波器提取的特征不足以构建音频的判别性表示。在本文中,我们提出了多尺度卷积操作,通过提高频率分辨率并在所有频率区域学习滤波器,可以获得更好的音频表示。为了在单一模型中利用基于波形的特征和基于频谱图的特征,我们引入了两阶段方法来融合不同特征。最后,我们基于多尺度卷积操作和两阶段方法提出了一种新颖的端到端网络 WaveMsNet。在环境声分类数据集 ESC-10 和 ESC-50 上,我们的 WaveMsNet 的分类准确率分别达到 93.75% 和 79.10%,较先前方法有显著提升。
引用
@article{arxiv.1803.10219,
title = {Learning Environmental Sounds with Multi-scale Convolutional Neural Network},
author = {Boqing Zhu and Changjian Wang and Feng Liu and Jin Lei and Zengquan Lu and Yuxing Peng},
journal= {arXiv preprint arXiv:1803.10219},
year = {2018}
}
备注
accepted by IJCNN 2018