中文

基于混合信号条件的生成分离歌声数据集

声音 2025-11-27 v1 人工智能

摘要

分离音乐混合信号中的 individual elements 是音乐分析和实践中必不可少的环节。虽然通常使用针对掩码或变换混合信号时频表示的神经网络来实现此任务,但生成式扩散模型的灵活性和泛化能力正在引领这一复杂任务的新型解决方案。在本工作中,我们探索了使用在对应混合信号上进行条件训练以生成 solo vocals 的扩散模型。我们的做法在先前的生成式系统基础上进行了改进,并通过使用补充数据实现了与非生成式基线相当的客观评分。扩散抽样的迭代性质使用户能够控制质量-效率权衡,并且可以在需要时对输出进行细化。我们呈现了抽样算法的消融研究,突出了用户可配置参数的影响。

关键词

引用

@article{arxiv.2511.21342,
  title  = {Generating Separated Singing Vocals Using a Diffusion Model Conditioned on Music Mixtures},
  author = {Genís Plaja-Roglans and Yun-Ning Hung and Xavier Serra and Igor Pereira},
  journal= {arXiv preprint arXiv:2511.21342},
  year   = {2025}
}

备注

Accepted for publication at WASPAA 2025