中文

SVSGAN:基于生成对抗网络的歌声分离

声音 2017-11-15 v2 机器学习 音频与语音处理

摘要

从音频混合信号中分离出两个声源是一项重要且具有众多应用的任务。由于仅有一个信号通道可供分析,这是一个具有挑战性的问题。本文提出了一种利用带时频掩蔽函数的生成对抗网络(GAN)进行歌声分离的新框架。混合谱被视为一种分布,并被映射到同样被视为分布的干净谱。混合谱与干净谱之间分布的近似在对抗训练过程中完成。与当前用于源分离的深度学习方法中不同,所提框架的参数首先在监督设定下初始化,然后通过 GAN 的训练过程在无监督设定下优化。在三个数据集(MIR-1K、iKala 和 DSD100)上的实验结果表明,由常规网络构成的所提框架能够提升性能。

关键词

引用

@article{arxiv.1710.11428,
  title  = {SVSGAN: Singing Voice Separation via Generative Adversarial Network},
  author = {Zhe-Cheng Fan and Yen-Lin Lai and Jyh-Shing Roger Jang},
  journal= {arXiv preprint arXiv:1710.11428},
  year   = {2017}
}

备注

5 pages, 4 figures, 1 table. Demo website: http://mirlab.org/demo/svsgan