中文

基于 Sinkhorn 距离的歌声分离表示学习再探

声音 2021-01-11 v2 音频与语音处理

摘要

在这项工作中,我们提出了一种用于音频表示无监督学习的方法,聚焦于歌声分离任务。我们建立在先前提出的一种利用重参数化去噪自编码器学习时域音乐信号表示的方法之上,通过使用带熵正则化的 Sinkhorn 距离族对其进行了扩展。我们在公开可用的专业制作音乐录音数据集 MUSDB18 上评估了我们的方法,结果表明,具有较小熵正则化强度的 Sinkhorn 距离能略微提升有信息歌声分离的性能。通过增大熵正则化强度,混合信号的所学表示由几乎完美可加且结构清晰的声源组成。

关键词

引用

@article{arxiv.2007.02780,
  title  = {Revisiting Representation Learning for Singing Voice Separation with Sinkhorn Distances},
  author = {Stylianos Ioannis Mimilakis and Konstantinos Drossos and Gerald Schuller},
  journal= {arXiv preprint arXiv:2007.02780},
  year   = {2021}
}

备注

Update including additional results justifying hyper-parameter choices, clarifications for the supervision debate, notes on interpretability