中文

PodcastMix:一个用于播客中音乐与语音分离的数据集

声音 2022-07-18 v1 数据库 音频与语音处理

摘要

我们提出 PodcastMix,一个形式化播客中背景音乐与前景语音分离任务的数据集。我们旨在定义一个适用于训练和评估(深度学习)源分离模型的基准。为此,我们发布了一个基于程序化生成播客的大型多样化训练数据集。然而,当前(深度学习)模型可能出现泛化问题,尤其在合成数据上训练时。为应对潜在泛化问题,我们发布了一个基于真实播客的评估集,并为其设计了客观与主观测试。在真实播客实验中,我们发现当前(深度学习)模型可能存在泛化问题。但它们仍可表现胜任,例如我们最佳基线以平均意见得分 3.84(对“整体分离质量”从 1 到 5 评分)分离语音。数据集与基线可在线获取。

关键词

引用

@article{arxiv.2207.07403,
  title  = {PodcastMix: A dataset for separating music and speech in podcasts},
  author = {Nicolás Schmidt and Jordi Pons and Marius Miron},
  journal= {arXiv preprint arXiv:2207.07403},
  year   = {2022}
}

备注

In proceedings of INTERSPEECH2022. Project webpage: http://www.jordipons.me/apps/podcastmix/