中文

用于单声道音频源分离的多分辨率全卷积神经网络

声音 2017-11-01 v1 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

在具有卷积层的深度神经网络中,每层通常具有固定尺寸/单分辨率的感受野(RF)。具有大RF的卷积层从输入特征中捕获全局信息,而具有小RF尺寸的层从输入特征中以高分辨率捕获局部细节。在本工作中,我们引入新颖的深度多分辨率全卷积神经网络(MR-FCNN),其中每层具有不同的RF尺寸以提取多分辨率特征,从而从其输入特征中捕获全局和局部细节信息。所提出的MR-FCNN被用于从多音频源混合中分离目标音频源。实验结果表明,在音频源分离问题上,使用MR-FCNN相比前馈深度神经网络(DNNs)和单分辨率深度全卷积神经网络(FCNNs)提升了性能。

关键词

引用

@article{arxiv.1710.11473,
  title  = {Multi-Resolution Fully Convolutional Neural Networks for Monaural Audio Source Separation},
  author = {Emad M. Grais and Hagen Wierstorf and Dominic Ward and Mark D. Plumbley},
  journal= {arXiv preprint arXiv:1710.11473},
  year   = {2017}
}

备注

arXiv admin note: text overlap with arXiv:1703.08019