中文

音乐源恢复

声音 2025-05-29 v1 人工智能 机器学习 音频与语音处理

摘要

我们引入了音乐源恢复(MSR),这是一项旨在解决理想化源分离与真实世界音乐制作之间差距的新颖任务。当前的 Music Source Separation (MSS) 方法假设混合物是音源的简单总和,忽略了音乐制作过程中采用的信号退化,如均衡、压缩和混响。MSR 将混合物建模为单独退化的音源退化后的总和,目标是恢复原始的、未退化的信号。由于缺乏用于 MSR 的数据,我们提出了 RawStems,这是一个包含 578 首歌曲的数据集标注,其未处理的源信号被组织为 8 个主要和 17 个次要乐器组,总计 354.13 小时。据我们所知,RawStems 是第一个包含具有层次类别的未处理音乐音轨的数据集。我们将频谱滤波、动态范围压缩、谐波失真、混响和有损编解码器视为可能的退化,并建立 U-Former 作为基线方法,证明了 MSR 在我们数据集上的可行性。我们公开发布 RawStems 数据集标注、退化模拟流程、训练代码和预训练模型。

关键词

引用

@article{arxiv.2505.21827,
  title  = {Music Source Restoration},
  author = {Yongyi Zang and Zheqi Dai and Mark D. Plumbley and Qiuqiang Kong},
  journal= {arXiv preprint arXiv:2505.21827},
  year   = {2025}
}

备注

A modified version of this paper is in review