中文

Pac-HuBERT:基于原始听觉聚类与隐藏单元 BERT 的自监督音乐源分离

声音 2023-04-06 v1 机器学习 音频与语音处理

摘要

尽管音乐源分离研究取得了进展,但公开可用的干净源数据量较少始终是限制性能的一个因素。因此,自监督学习的最新进展通过利用未标记的音乐数据来改进分离模型,提供了一个很大程度上未被探索的机会。在本文中,我们提出了一种受 HuBERT 语音表示模型启发的音乐源分离自监督学习框架。我们首先通过将一个适配版本的原始 HuBERT 模型插入著名的 Demucs V2 时域分离模型架构中,来研究原始 HuBERT 模型的潜在影响。然后我们提出了一个时频域自监督模型 Pac-HuBERT(原始听觉聚类 HuBERT),随后我们将其与 Res-U-Net 解码器结合用于源分离。Pac-HuBERT 使用音乐的原 auditory 特征作为无监督聚类标签,利用 Free Music Archive (FMA) 数据集初始化自监督预训练过程。所得框架在 MusDB18 测试集上取得了比原始 Demucs V2 和 Res-U-Net 模型更好的信源失真比(SDR)性能。我们进一步证明,它能在少量监督数据下提升性能。最终,我们提出的框架是针对音乐源分离中干净源数据有限这一挑战的有效解决方案。

关键词

引用

@article{arxiv.2304.02160,
  title  = {Pac-HuBERT: Self-Supervised Music Source Separation via Primitive Auditory Clustering and Hidden-Unit BERT},
  author = {Ke Chen and Gordon Wichern and François G. Germain and Jonathan Le Roux},
  journal= {arXiv preprint arXiv:2304.02160},
  year   = {2023}
}

备注

5 pages, 2 figures, 3 tables