中文

面向卡拉OK内容生成的歌手分离

声音 2024-08-20 v4 多媒体 音频与语音处理

摘要

由于深度学习的快速发展,我们现在可以成功地将歌唱声音从单声道音频音乐中分离出来。然而,这种分离只能从其他乐器中提取人声,这对于仅需分离主唱的卡拉OK内容生成应用而言是不理想的。对于该卡拉OK应用,我们需要将包含男女二重唱的音乐分离为两路人声,或从含人声和声的音乐中提取单一主唱人声。为此,我们在本文中提出使用歌手分离系统,为一到两名分离出的主唱生成卡拉OK内容。特别地,我们为歌手分离任务引入了三种模型,并设计了一种自动模型选择方案以区分歌曲中有多少名主唱。我们还收集了足够大的数据集 MIR-SingerSeparation,并已公开发布以推进该研究领域的前沿。我们的歌手分离最适用于抒情 ballad,并可直接应用于卡拉OK内容生成。据我们所知,这是首个面向真实世界卡拉OK应用的歌手分离工作。

关键词

引用

@article{arxiv.2110.06707,
  title  = {Singer separation for karaoke content generation},
  author = {Hsuan-Yu Lin and Xuanjun Chen and Jyh-Shing Roger Jang},
  journal= {arXiv preprint arXiv:2110.06707},
  year   = {2024}
}