用于歌声分离的多频带多分辨率全卷积神经网络
声音
2019-10-22 v1 机器学习
音频与语音处理
信号处理
机器学习
摘要
具有卷积层的深度神经网络通常以相同的时间-频率分辨率、滤波器数量和降维尺度处理音频信号的整个谱图。根据常 Q 变换,若以高频分辨率滤波器处理低频带、以高时间分辨率滤波器处理高频带,则可从音频信号中提取良好特征。在歌声与音乐信号混合的谱图中,低频带通常比高频带含有更多关于人声的信息。这就提出了对谱图不同部分进行差异化处理的需求。本文提出一种用于歌声分离的多频带多分辨率全卷积神经网络(MBR-FCN)。MBR-FCN 以更多滤波器和更小降维尺度处理含有较多目标信号信息的频带,而非信息较少的频带。此外,MBR-FCN 以高频分辨率滤波器处理低频带,以高时间分辨率滤波器处理高频带。实验结果表明,所提参数量极少的 MBR-FCN 取得了优于其他深度神经网络的歌声分离性能。
引用
@article{arxiv.1910.09266,
title = {Multi-Band Multi-Resolution Fully Convolutional Neural Networks for Singing Voice Separation},
author = {Emad M. Grais and Fei Zhao and Mark D. Plumbley},
journal= {arXiv preprint arXiv:1910.09266},
year = {2019}
}