中文

基于内容的音乐混合中歌唱声音提取

音频与语音处理 2020-02-18 v2 机器学习 声音

摘要

我们提出了一种基于深度学习的方法,用于根据底层语言内容从音乐混合信号中提取歌唱声音信号。我们的模型遵循编码器-解码器架构,以含人声的音乐混合的频谱图幅度分量作为输入。模型的编码器部分通过知识蒸馏使用教师网络进行训练,以学习内容嵌入,并将其解码生成相应的声码器特征。使用该方法,我们能够从混合中提取未处理的原始人声信号,即使对于训练时未见过歌手的处理后混合数据集也是如此。尽管我们系统的性质使其与传统客观评价指标不相适应,我们通过听测的主观评价将该方法与最先进的(state-of-the-art)基于深度学习的源分离算法进行比较。我们还提供了声音示例和源代码以保证可复现性。

关键词

引用

@article{arxiv.2002.04933,
  title  = {Content Based Singing Voice Extraction From a Musical Mixture},
  author = {Pritish Chandna and Merlijn Blaauw and Jordi Bonada and Emilia Gomez},
  journal= {arXiv preprint arXiv:2002.04933},
  year   = {2020}
}

备注

To be published in ICASSP 2020