中文

利用三维卷积神经网络学习通道间特征的多通道声音事件检测

声音 2018-01-30 v1 机器学习 音频与语音处理

摘要

本文中,我们提出一种堆叠卷积与循环神经网络(CRNN),其第一层为三维卷积神经网络(CNN),用于多通道声音事件检测(SED)任务。三维CNN使网络能够从输入多通道音频中同时学习通道间与通道内特征。为评估所提方法,我们合成了具有不同数量重叠声源的多通道音频数据集。每个数据集均有四通道一阶Ambisonic、双耳和单通道版本,我们在其上比较使用所提方法的SED性能,以研究使用多通道音频进行SED的潜力。并使用真实录音TUT-SED 2017开发数据集的双耳与单通道版本进行了类似研究。所提方法能从多通道特征中更快识别重叠声音事件,并以更少训练轮次实现更好的SED。结果表明,用多通道Ambisonic音频替代单通道音频,整体F分数提高7.5%,整体错误率降低10%,并在含四个重叠声源的时间帧中多识别出15.6%的声音事件。

关键词

引用

@article{arxiv.1801.09522,
  title  = {Multichannel Sound Event Detection Using 3D Convolutional Neural Networks for Learning Inter-channel Features},
  author = {Sharath Adavanne and Archontis Politis and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:1801.09522},
  year   = {2018}
}