中文

MAJL:面向音乐源分离与音高估计的模型无关联合学习框架

声音 2025-01-08 v1 人工智能 音频与语音处理

摘要

音乐源分离与音高估计是音乐信息检索中的两个关键任务。通常情况下,音高估计的输入来自音乐源分离的输出。因此,现有方法尝试同时完成这两个任务,以利用两者之间的相互优势。然而,这些方法仍面临两个关键挑战:标签数据的缺乏以及联合学习优化。在针对这些挑战时,我们提出了面向音乐源分离与音高估计的模型无关联合学习(MAJL)框架。MAJL是一个通用框架,可为每个任务使用不同模型。它包含两个训练阶段和一个名为“动态硬样本权重”(DWHS)的动态加权方法,分别解决标签数据不足和联合学习优化的问题。在公开音乐数据集上的实验结果表明,MAJL 在两个任务上均优于当前最先进的方法,音乐源分离的信噪比失真比(SDR)提升了 0.92,音高估计的原始音高准确率(RPA)提升了 2.71%。此外,详尽的研究不仅验证了MAJL每个组件的有效性,还表明MAJL在适应不同模型架构方面具有很好的通用性。

关键词

引用

@article{arxiv.2501.03689,
  title  = {MAJL: A Model-Agnostic Joint Learning Framework for Music Source Separation and Pitch Estimation},
  author = {Haojie Wei and Jun Yuan and Rui Zhang and Quanyu Dai and Yueguo Chen},
  journal= {arXiv preprint arXiv:2501.03689},
  year   = {2025}
}