中文

勿分离,学重混:基于联合优化的端到端神经重混

音频与语音处理 2021-10-25 v2 声音

摘要

操控单个乐器的电平和/或效果以重新组合录音混合物(即重混)的任务在音乐制作、音视频后期制作、播客等多种应用中十分常见。然而,该过程传统上需要访问各个源录音,限制了创作过程。为规避此问题,源分离算法可将混合物分离为其各组分,随后用户可调整其电平并重新混合。但这一两步法仍存在可听伪影,并促使进一步研究。在本工作中,我们通过将知名的源分离模型 Conv-TasNet 改造为两种神经重混架构,直接学习音乐重混。为此,我们使用一个显式损失项直接衡量重混质量,并与分离损失联合优化。我们使用 Slakh 和 MUSDB18 数据集评估我们的方法,并报告重混性能以及作为副产品的对源分离的影响。我们的结果表明,学习重混显著优于强分离基线,尤其适用于小幅音量变化。

关键词

引用

@article{arxiv.2107.13634,
  title  = {Don't Separate, Learn to Remix: End-to-End Neural Remixing with Joint Optimization},
  author = {Haici Yang and Shivani Firodiya and Nicholas J. Bryan and Minje Kim},
  journal= {arXiv preprint arXiv:2107.13634},
  year   = {2021}
}