中文

用于单声道歌唱声分离的演化多分辨率池化CNN

音频与语音处理 2020-08-04 v1 机器学习 声音

摘要

单声道歌唱声分离(MSVS)是一项具有挑战性的任务,已被研究数十年。深度神经网络(DNNs)是当前MSVS的最先进方法。然而,现有DNN往往由人工手动设计,耗时且易错。此外,网络架构通常是预定义的,并未针对训练数据进行适配。为解决这些问题,我们将神经架构搜索(NAS)方法引入MSVS的DNN结构设计。具体而言,我们提出了一种用于MSVS的新的多分辨率卷积神经网络(CNN)框架,即多分辨率池化CNN(MRP-CNN),其使用不同尺寸的池化算子来提取多分辨率特征。基于NAS,我们进而开发了一种演化框架,称为演化MRP-CNN(E-MRP-CNN),通过遗传算法自动搜索有效的MRP-CNN结构,以仅考虑分离性能的单目标或同时考虑分离性能与模型复杂度的多目标进行优化。多目标E-MRP-CNN给出一组Pareto最优解,每个解都提供了分离性能与模型复杂度之间的权衡。在MIR-1K与DSD100数据集上的定量与定性评估被用于证明所提框架相对于若干近期基线的优势。

关键词

引用

@article{arxiv.2008.00816,
  title  = {Evolving Multi-Resolution Pooling CNN for Monaural Singing Voice Separation},
  author = {Weitao Yuan and Bofei Dong and Shengbei Wang and Masashi Unoki and Wenwu Wang},
  journal= {arXiv preprint arXiv:2008.00816},
  year   = {2020}
}