DJCM:一种用于歌声分离与音高估计的深度联合级联模型
声音
2024-03-20 v1 音频与语音处理
摘要
歌声分离和音高估计是音乐信息检索中的关键任务。现有的同时提取干净人声和音高的方法可分为两类:流水线方法和朴素联合学习方法。然而,这些方法的有效性受到以下问题的限制:一方面,流水线方法为每个任务独立训练模型,导致训练和测试时的数据分布不匹配。另一方面,朴素联合学习方法简单地将两个任务的损失相加,可能导致每个任务的不同目标之间出现错位。为解决这些问题,我们提出了一种用于歌声分离和音高估计的深度联合级联模型(DJCM)。DJCM采用新颖的联合级联模型结构来同时训练两个任务。此外,使用任务特定的权重来对齐两个任务的不同目标。实验结果表明,DJCM在两个任务上都达到了最先进的性能,在歌声分离方面,信号失真比(SDR)大幅提升了0.45,在音高估计方面,总体准确率(OA)提升了2.86%。此外,广泛的消融研究验证了我们所提出模型每个设计的有效性。DJCM的代码可在https://github.com/Dream-High/DJCM获取。
引用
@article{arxiv.2401.03856,
title = {DJCM: A Deep Joint Cascade Model for Singing Voice Separation and Vocal Pitch Estimation},
author = {Haojie Wei and Xueke Cao and Wenbo Xu and Tangpeng Dan and Yueguo Chen},
journal= {arXiv preprint arXiv:2401.03856},
year = {2024}
}
备注
This paper has been accepted by ICASSP 2024